Skip to content

Alertmanager 最佳实践配置(rancher-monitoring)

架构

  Prometheus 规则评估 → 告警


  Alertmanager ×2(gossip HA 集群)
        │ 分组(alertname+namespace+severity) / 抑制(critical>warning>info)
        │ 分级重复(critical 2h / warning 6h / 默认 12h) / Watchdog·info 降噪
        ▼ webhook receiver
  alertmanager-feishu-adapter(格式转换 + AI 值班初判)

  飞书群机器人(🔥触发 / ✅恢复,severity 图标分级)
        + firing critical 异步补推 🤖 AI 值班初判卡片(上下文自动收集 + AI 分析,2h 冷却)

最佳实践配置要点

配置理由
HA 副本2 副本 gossip通知链路无单点
分组group_by: [alertname, namespace, severity]同类告警合并一条消息,防刷屏
节奏group_wait: 30s / group_interval: 5m首批等 30s 凑组,增量 5m 一批
分级重复critical 2h / warning 6h / 默认 12h严重的催得紧,避免告警疲劳
降噪Watchdog、info/none → null只推 actionable 告警
抑制critical 抑制同对象 warning/info已有规则保留
恢复通知send_resolved: true告警闭环,知道何时恢复
声明式配置helm values(--reuse-values -f可重复、可审计、随 chart 升级保留
webhook 保密Secret 存储不入库不入文档
AI 值班初判critical 告警 → 只读收集上下文 → qwen-plus 初判卡片告警来了先看 AI 分析再动手;2h 冷却防重复

文件

alertmanager/
├── deploy.sh                  # 一键配置(all|check,check 含端到端测试)
├── feishu-adapter.yaml        # 飞书适配器(SA+只读RBAC+Secret+ConfigMap+Deployment+Service)
├── alertmanager-values.yaml   # Alertmanager 最佳实践 values(叠加 rancher-monitoring)
├── .secrets.env               # 飞书 webhook + DashScope Key(勿提交公共仓库)
└── README.md / 部署文档.md / 操作文档.md

部署命令

bash
export KUBECONFIG=~/.kube/config-122.31
cd alertmanager/
./deploy.sh          # 配置 + 端到端验证(约 40s 后飞书收到测试告警)