主题
00 前言与学习建议
本教材以"Kubernetes 核心 → RKE2 生产部署 → 辅助工具生态 → 综合实战"为主线,帮助运维工程师从零基础成长为能独立规划、部署、运维生产级 K8s 集群的工程师。
为什么写这套教材
市面上的 K8s 资料有两个常见问题:
- 只讲 K8s,不讲发行版:学了半天 Deployment 和 Service,到了生产环境面对 RKE2、OpenShift、Kubeadm 依然无从下手。
- 只讲主菜,不讲工具:真正的运维效率差距,往往体现在 k9s、K8sGPT、Velero、Trivy 这些辅助工具的掌握程度上。
本教材把三者串成一条完整链路:Kubernetes(内核)→ RKE2(落地)→ 工具生态(效率),并以综合实战与故障排查手册收尾。
为什么是 RKE2
RKE2(Rancher Kubernetes Engine 2)是 Rancher 推出的企业级 K8s 发行版,特点是:
- 安全合规:默认 CIS 加固,支持 SELinux、FIPS 140-2
- 运维简单:单一二进制 + systemd 管理,控制平面以静态 Pod 运行
- 生产就绪:内置 etcd 快照、证书轮换、system-upgrade-controller 自动升级
- 国内友好:支持
INSTALL_RKE2_MIRROR=cn国内镜像源
对于运维团队而言,RKE2 在"易用性"与"可控性"之间取得了很好的平衡,是本教材选择的落地发行版。
为什么重点讲 K8sGPT
AI 辅助运维是近两年 K8s 生态最重要的变化之一。K8sGPT 将 SRE 经验编码为分析器(analyzer),自动扫描集群问题,并可接入 OpenAI / Ollama 等大模型给出人话解释与修复建议。它能:
- 把
ImagePullBackOff、Pending、CrashLoopBackOff等问题的定位从"半小时翻日志"缩短到"一条命令" - 通过
anonymize脱敏后接入云端大模型,或在离线环境用 Ollama 本地模型 - 与 Trivy、Prometheus 集成,形成"监控 → 告警 → AI 诊断"闭环
第四部分对 K8sGPT 做了全书最深的专题讲解。
学习方法
- 三遍学习法:
- 第一遍通读,建立知识地图(知道有什么);
- 第二遍动手,每条命令在实验集群执行(知道怎么用);
- 第三遍输出,给同事讲一遍或写笔记(真正掌握)。
- 故障驱动:第三、五部分的故障案例,建议在实验环境刻意制造故障再修复——排错能力只能练出来。
- 版本意识:K8s 每 4 个月一个版本,教材基于 v1.28+;执行命令前先
kubectl version确认,注意 API 版本变化。 - 最小必要原则:工具不是装得越多越好。第四部分每个工具都给了"适用场景",按需引入。
实验环境准备
| 环境 | 用途 | 最低配置 |
|---|---|---|
| 本机 minikube / kind | 第一、二部分练习 | 2C4G |
| 2~3 台 VM(Rocky Linux 9 / Ubuntu 22.04) | RKE2 单节点与 HA 练习 | 每台 2C4G、20G 磁盘 |
| (可选)6 台 VM | 第五部分生产级综合实战 | 每台 2C4G |
提示:本仓库
sz-rocky9-vm/和virsh/目录提供了批量创建 KVM 虚拟机的脚本,可用于快速准备实验环境。
配套仓库资源
rke2/:安装脚本、server-config.yaml、agent-config.yaml、registries.yaml真实示例k8s-issues/:RKE2 生产故障案例(控制平面 quorum 丢失、防火墙阻断 join、镜像导入延迟等),教材中大量引用k8s-service/textbook/、metaLB/:网络专题深入阅读
现在,从 第一部分 Kubernetes 入门与核心概念 开始。