AIOps智能故障自愈服务器自动处理各类告警
服务器告警一多,靠人工逐个排查处理迟早会出问题。
AIOps智能故障自愈就是让系统自动识别告警并执行修复动作,比如进程挂了自动重启、磁盘满了自动清理、负载过高自动扩容。
本文从零开始,演示如何用开源的Prometheus + Alertmanager + 自愈脚本搭建一套可用的自愈系统。
环境准备
你需要一台Linux服务器(CentOS 7+或Ubuntu 20.04均可),内存至少2GB,已安装Docker或直接安装Prometheus、Alertmanager。
以下示例使用Docker简化部署。
- 创建目录用于存放配置:
mkdir -p /opt/aiops && cd /opt/aiops
- 下载示例配置文件:
wget https://raw.githubusercontent.com/prometheus/prometheus/main/documentation/examples/prometheus.yml -O prometheus.yml
wget https://raw.githubusercontent.com/prometheus/alertmanager/main/doc/examples/alertmanager.yml -O alertmanager.yml
配置告警规则与自愈Webhook
核心思路:Alertmanager收到告警后,通过webhook发送给一个自愈服务,自愈服务解析告警并执行相应修复脚本。
添加告警规则
编辑prometheus.yml,在rule_files下添加告警规则文件。
先创建rules.yml:
groups:
- name: selfheal
rules:
- alert: NodeDown
expr: up == 0
for: 1m
labels:
severity: critical
annotations:
summary: "主机 {{ $labels.instance }} 离线"
然后在prometheus.yml中添加:
rule_files:
- '/opt/aiops/rules.yml'
配置Alertmanager Webhook
编辑alertmanager.yml,添加一个webhook接收器:
route:
receiver: 'selfheal'
receivers:
- name: 'selfheal'
webhook_configs:
- url: 'http://localhost:5000/webhook'
send_resolved: true
这里自愈服务运行在5000端口,可以自己写一个简单的Python Flask应用来接收告警并执行脚本。
编写自愈服务(Python示例)
创建文件selfheal.py:
from flask import Flask, request, json
import subprocess
app = Flask(__name__)
@app.route('/webhook', methods=['POST'])
def webhook():
alert_data = request.json
alerts = alert_data.get('alerts', [])
for alert in alerts:
labels = alert.get('labels', {})
alertname = labels.get('alertname')
if alertname == 'NodeDown':
# 示例:执行SSH重连脚本,或调用云API重启实例
instance = labels.get('instance')
subprocess.run(['python3', '/opt/aiops/restart_instance.py', instance])
return 'ok'
if __name__ == '__main__':
app.run(host='0.0.0.0', port=5000)
实际生产中请根据告警类型编写对应的修复脚本,比如清理磁盘、重启服务等。
避坑指南
- 自愈脚本必须健壮:添加超时、重试和日志记录,防止脚本卡死导致告警风暴。
- 风险控制:不要自动修复所有告警,尤其是对生产有破坏性的操作(如删数据)。建议先对非关键告警启用自愈。
- 幂等性:修复脚本应保证多次执行结果一致,避免重复修复造成资源浪费。
- 测试告警:使用
amtool或直接curl发送测试告警到Alertmanager,验证自愈链路是否畅通。
效果验证
- 模拟节点故障:停止目标主机的node_exporter或直接关机。
- 观察Alertmanager是否收到告警,自愈服务日志是否打印收到webhook。
- 检查修复动作是否执行,例如进程是否被重启,或者在Prometheus中查看告警状态是否恢复。
你也可以通过Prometheus的/alerts页面查看当前告警状态,或者使用curl http://localhost:9090/api/v1/alerts来确认。
常见问题
Q:自愈服务频繁收到同一告警,怎么办?
A:确保Alertmanager配置了group_wait和group_interval,并且自愈脚本要有防重复机制(例如记录已处理告警ID)。
Q:如何避免误自愈?
A:调整告警规则中的for时长,确认告警持续一定时间再触发;自愈服务中增加条件判断,如先手动确认。
Q:不想用Python,可以用其他语言吗?
A:可以,任何能监听HTTP请求并执行Shell命令的语言都行,Go、Node.js等都可。
如果你正在处理AIOps智能故障自愈的实现,建议先按本文步骤部署最小可运行版本,再根据业务告警类型逐步添加自愈脚本。
遇到异常时优先检查自愈服务日志和Alertmanager配置是否正确。