主题
Alertmanager 最佳实践配置(rancher-monitoring)
架构
Prometheus 规则评估 → 告警
│
▼
Alertmanager ×2(gossip HA 集群)
│ 分组(alertname+namespace+severity) / 抑制(critical>warning>info)
│ 分级重复(critical 2h / warning 6h / 默认 12h) / Watchdog·info 降噪
▼ webhook receiver
alertmanager-feishu-adapter(格式转换 + AI 值班初判)
▼
飞书群机器人(🔥触发 / ✅恢复,severity 图标分级)
+ firing critical 异步补推 🤖 AI 值班初判卡片(上下文自动收集 + AI 分析,2h 冷却)最佳实践配置要点
| 项 | 配置 | 理由 |
|---|---|---|
| HA 副本 | 2 副本 gossip | 通知链路无单点 |
| 分组 | group_by: [alertname, namespace, severity] | 同类告警合并一条消息,防刷屏 |
| 节奏 | group_wait: 30s / group_interval: 5m | 首批等 30s 凑组,增量 5m 一批 |
| 分级重复 | critical 2h / warning 6h / 默认 12h | 严重的催得紧,避免告警疲劳 |
| 降噪 | Watchdog、info/none → null | 只推 actionable 告警 |
| 抑制 | critical 抑制同对象 warning/info | 已有规则保留 |
| 恢复通知 | send_resolved: true | 告警闭环,知道何时恢复 |
| 声明式配置 | helm values(--reuse-values -f) | 可重复、可审计、随 chart 升级保留 |
| webhook 保密 | Secret 存储 | 不入库不入文档 |
| AI 值班初判 | critical 告警 → 只读收集上下文 → qwen-plus 初判卡片 | 告警来了先看 AI 分析再动手;2h 冷却防重复 |
文件
alertmanager/
├── deploy.sh # 一键配置(all|check,check 含端到端测试)
├── feishu-adapter.yaml # 飞书适配器(SA+只读RBAC+Secret+ConfigMap+Deployment+Service)
├── alertmanager-values.yaml # Alertmanager 最佳实践 values(叠加 rancher-monitoring)
├── .secrets.env # 飞书 webhook + DashScope Key(勿提交公共仓库)
└── README.md / 部署文档.md / 操作文档.md部署命令
bash
export KUBECONFIG=~/.kube/config-122.31
cd alertmanager/
./deploy.sh # 配置 + 端到端验证(约 40s 后飞书收到测试告警)