主题
RKE2 数千节点:方案、配置、运维、观测及优化
一套面向资深运维/平台工程师的大规模 RKE2 集群实战教材:从数千节点的架构设计与容量规划,到自动化部署、SRE 运维体系、可观测性体系、性能调优,再到故障案例库与最佳实践总纲。
适用读者
- 已经掌握 Kubernetes 核心概念与 RKE2 基本部署的工程师
- 负责或即将负责数百至数千节点规模集群的 SRE / 平台工程师
- 需要做大规模集群容量规划、性能调优、稳定性建设的技术负责人
如果 K8s / RKE2 基础尚不牢固,请先学习本仓库的《Kubernetes + RKE2 + K8s 辅助工具:从入门到精通》。
前置要求
- 熟练使用 kubectl 与 Helm/Kustomize
- 独立部署过 RKE2 HA 集群,了解 etcd 快照、升级、证书轮换
- 具备 Prometheus + Grafana 监控经验
- 熟悉 Linux 性能分析基础(iostat、ss、fio 等)
教材结构
| 部分 | 文件 | 内容 |
|---|---|---|
| 前言 | 00-前言.md | 大规模集群的特殊性、学习方法、实验环境 |
| 第一部分 | 第一部分-数千节点架构设计与容量规划.md | K8s 扩展性边界与 SLI/SLO、控制平面拓扑、etcd 大规模设计、CNI/IP 规划、DNS 与镜像基础设施、3000 节点容量测算、多集群方案 |
| 第二部分 | 第二部分-大规模集群配置与自动化部署.md | OS 标准化基线、大规模 config.yaml 模板集、APF 详解、镜像源方案、Ansible 批量部署实战、自动注册、GitOps 配置漂移控制 |
| 第三部分 | 第三部分-大规模集群运维体系.md | SRE 方法论、升级体系(system-upgrade-controller 深度实战)、节点生命周期、etcd 运维、证书与安全、资源治理、应急预案与演练 |
| 第四部分 | 第四部分-大规模可观测性体系.md | 指标基数治理、Thanos/VictoriaMetrics 实战、控制平面深度监控与告警规则、Loki 日志体系、告警治理、Hubble/eBPF、K8sGPT AI 辅助观测 |
| 第五部分 | 第五部分-性能优化与调优.md | 压测方法论(kube-burner)、etcd/apiserver/kubelet/网络/DNS/镜像/调度/存储全链路优化(现象→根因→优化→验证) |
| 第六部分 | 第六部分-大规模故障案例与最佳实践.md | 15 个大规模故障完整复盘、五维度军规、50 条生产就绪检查清单 |
| 附录 | 附录-速查表与检查清单.md | 命令/指标阈值/参数推荐值/内核参数/端口清单/容量估算公式速查 |
学习路线(建议 10~14 周)
| 阶段 | 周期 | 内容 | 自测标准 |
|---|---|---|---|
| 第一阶段 | 第 1~2 周 | 第一部分:架构设计与容量规划 | 能独立产出一份 3000 节点集群的架构设计与容量测算文档 |
| 第二阶段 | 第 3~4 周 | 第二部分:配置与自动化部署 | 能用 Ansible 批量部署 RKE2 集群并配置 APF 与镜像源 |
| 第三阶段 | 第 5~7 周 | 第三部分:运维体系 | 能编写大规模升级 Runbook 并演练 etcd 灾难恢复 |
| 第四阶段 | 第 8~9 周 | 第四部分:可观测性体系 | 能搭建 Thanos/VictoriaMetrics 并配置控制平面告警规则 |
| 第五阶段 | 第 10~11 周 | 第五部分:性能优化 | 能用 kube-burner 压测并完成一轮 etcd/apiserver 调优 |
| 第六阶段 | 第 12~14 周 | 第六部分:故障案例与最佳实践 | 能对照案例库独立复盘并输出本团队的生产就绪检查清单 |
配套资源
- ../rke2/:RKE2 安装脚本与 server/agent 配置真实素材(第二、三部分大量引用)
- ../k8s-issues/:RKE2 生产故障案例(quorum 丢失、防火墙阻断 join 等,第三、六部分引用)
- ../k8s-rke2-textbook/:K8s + RKE2 + 工具生态入门到精通(前置教材)
- ../metaLB/:CoreDNS、iptables/IPVS 等网络专题深入阅读
- ../k8s-service/textbook/:Service 网络专题教材