AIOps智能故障自愈服务器自动处理各类告警

服务器告警一多,靠人工逐个排查处理迟早会出问题。
AIOps智能故障自愈就是让系统自动识别告警并执行修复动作,比如进程挂了自动重启、磁盘满了自动清理、负载过高自动扩容。
本文从零开始,演示如何用开源的Prometheus + Alertmanager + 自愈脚本搭建一套可用的自愈系统。

环境准备

你需要一台Linux服务器(CentOS 7+或Ubuntu 20.04均可),内存至少2GB,已安装Docker或直接安装Prometheus、Alertmanager。
以下示例使用Docker简化部署。

  1. 创建目录用于存放配置:
mkdir -p /opt/aiops && cd /opt/aiops
  1. 下载示例配置文件:
wget https://raw.githubusercontent.com/prometheus/prometheus/main/documentation/examples/prometheus.yml -O prometheus.yml
wget https://raw.githubusercontent.com/prometheus/alertmanager/main/doc/examples/alertmanager.yml -O alertmanager.yml

配置告警规则与自愈Webhook

核心思路:Alertmanager收到告警后,通过webhook发送给一个自愈服务,自愈服务解析告警并执行相应修复脚本。

添加告警规则

编辑prometheus.yml,在rule_files下添加告警规则文件。
先创建rules.yml:

groups:
  - name: selfheal
    rules:
      - alert: NodeDown
        expr: up == 0
        for: 1m
        labels:
          severity: critical
        annotations:
          summary: "主机 {{ $labels.instance }} 离线"

然后在prometheus.yml中添加:

rule_files:
  - '/opt/aiops/rules.yml'

配置Alertmanager Webhook

编辑alertmanager.yml,添加一个webhook接收器:

route:
  receiver: 'selfheal'
receivers:
  - name: 'selfheal'
    webhook_configs:
      - url: 'http://localhost:5000/webhook'
        send_resolved: true

这里自愈服务运行在5000端口,可以自己写一个简单的Python Flask应用来接收告警并执行脚本。

编写自愈服务(Python示例)

创建文件selfheal.py

from flask import Flask, request, json
import subprocess
app = Flask(__name__)

@app.route('/webhook', methods=['POST'])
def webhook():
    alert_data = request.json
    alerts = alert_data.get('alerts', [])
    for alert in alerts:
        labels = alert.get('labels', {})
        alertname = labels.get('alertname')
        if alertname == 'NodeDown':
            # 示例:执行SSH重连脚本,或调用云API重启实例
            instance = labels.get('instance')
            subprocess.run(['python3', '/opt/aiops/restart_instance.py', instance])
    return 'ok'

if __name__ == '__main__':
    app.run(host='0.0.0.0', port=5000)

实际生产中请根据告警类型编写对应的修复脚本,比如清理磁盘、重启服务等。

避坑指南

  • 自愈脚本必须健壮:添加超时、重试和日志记录,防止脚本卡死导致告警风暴。
  • 风险控制:不要自动修复所有告警,尤其是对生产有破坏性的操作(如删数据)。建议先对非关键告警启用自愈。
  • 幂等性:修复脚本应保证多次执行结果一致,避免重复修复造成资源浪费。
  • 测试告警:使用amtool或直接curl发送测试告警到Alertmanager,验证自愈链路是否畅通。

效果验证

  1. 模拟节点故障:停止目标主机的node_exporter或直接关机。
  2. 观察Alertmanager是否收到告警,自愈服务日志是否打印收到webhook。
  3. 检查修复动作是否执行,例如进程是否被重启,或者在Prometheus中查看告警状态是否恢复。

你也可以通过Prometheus的/alerts页面查看当前告警状态,或者使用curl http://localhost:9090/api/v1/alerts来确认。

常见问题

Q:自愈服务频繁收到同一告警,怎么办?
A:确保Alertmanager配置了group_wait和group_interval,并且自愈脚本要有防重复机制(例如记录已处理告警ID)。

Q:如何避免误自愈?
A:调整告警规则中的for时长,确认告警持续一定时间再触发;自愈服务中增加条件判断,如先手动确认。

Q:不想用Python,可以用其他语言吗?
A:可以,任何能监听HTTP请求并执行Shell命令的语言都行,Go、Node.js等都可。

如果你正在处理AIOps智能故障自愈的实现,建议先按本文步骤部署最小可运行版本,再根据业务告警类型逐步添加自愈脚本。
遇到异常时优先检查自愈服务日志和Alertmanager配置是否正确。

分享到:
上一篇
数据库定期自动碎片优化提速定时执行脚本实战
下一篇
慢查询批量优化脚本提升数据库整体查询速度的完整实操指南
1
系统公告

机房迁移升级通知

尊敬的用户: IP 段 103.23.148.x、156.224.29.x 原香港一区线路波动、攻击频繁,平台定于 7 月 5 日凌晨分批迁移至香港 GIA 机房,硬件升级 AMD 铂金机型。 迁移均在凌晨操作,最大程度降低业务影响,迁移期间服务器临时关机; 升级后配置不降低、费用不涨价,数据默认同步迁移; 迁移后 IP 全部更换,请及时修改域名解析、防火墙白名单; 建议提前备份重要数据,有问题可联系在线客服。 感谢理解与支持! 泽御云科技 2026.06.30
服务中心
客服
在线客服
24小时为您服务
咨询
联系我们
联系我们,为您的业务提供专属服务。
24/7 技术支持
如果您遇到寻求进一步的帮助,请过工单与我们进行联系。
24/7 即时支持
泽御云
售前客服
泽御云
泽御云
售后客服
泽御云
技术支持
评价
您对当前页面的整体感受是否满意?
😞
非常不满意
😕
不满意
😐
一般
🙂
满意
😊
非常满意