主题
Kubernetes + RKE2 + K8s 辅助工具:从入门到精通
一套面向运维工程师的系统性教材:从 Kubernetes 零基础入门,到 RKE2 生产级集群部署运维,再到 k9s、K8sGPT、Velero、ArgoCD 等辅助工具生态,最后以综合实战与故障排查手册收尾。
适用读者
- 有一定 Linux 基础、想系统学习 Kubernetes 的运维工程师
- 需要在生产环境部署、维护 RKE2 集群的工程师
- 希望掌握 K8s 周边工具链(尤其是 AI 辅助诊断 K8sGPT)提升运维效率的工程师
- 准备 CKA / CKS 认证或云原生面试的工程师
前置要求
- 熟悉 Linux 基本操作(systemd、网络、防火墙、存储)
- 了解 Docker / containerd 容器基本概念
- 有一台可实验的 Linux 机器或虚拟机(推荐 Rocky Linux 9 / Ubuntu 22.04,2C4G 以上)
教材结构
| 部分 | 文件 | 内容 |
|---|---|---|
| 前言 | 00-前言与学习建议.md | 教材定位、学习方法、实验环境准备 |
| 第一部分 | 第一部分-Kubernetes入门与核心概念.md | K8s 架构、kubectl 精通、工作负载、ConfigMap/Secret、Service、存储入门、命名空间与配额、排错入门 |
| 第二部分 | 第二部分-Kubernetes进阶实战.md | 调度、资源管理(HPA/VPA/KEDA)、存储进阶(CSI/快照)、网络进阶(IPVS/CoreDNS/Ingress/NetworkPolicy)、安全(RBAC/PSS)、可观测性、Helm 与 Kustomize |
| 第三部分 | 第三部分-RKE2从入门到精通.md | RKE2 架构与对比、安装、HA 部署、config.yaml 详解、registries.yaml、etcd 备份恢复、升级与证书轮换、内置组件与 HelmChart CRD、CIS 安全加固、故障排查大全 |
| 第四部分 | 第四部分-K8s辅助工具生态.md | 终端效率工具(k9s/kubectx/stern/krew)、可视化管理(Lens/Headlamp/Rancher)、AI 辅助诊断 K8sGPT(重点)、健康审计(Popeye/kube-score)、安全扫描(Trivy/kube-bench/Falco)、备份迁移(Velero)、GitOps(ArgoCD/Flux)、成本容量(OpenCost/Goldilocks)、网络流量工具(kubeshark/eBPF)、本地调试(Telepresence/kubectl debug) |
| 第五部分 | 第五部分-综合实战与故障排查手册.md | 生产级 RKE2 HA 集群搭建、监控告警→AI 诊断闭环、GitOps 流水线、备份灾难恢复演练、全栈故障排查速查手册 |
| 附录 | 附录-命令速查与资源.md | kubectl / RKE2 / 辅助工具速查表、YAML 模板、认证与学习资源 |
学习路线(建议 12~16 周)
| 阶段 | 周期 | 内容 | 目标 | 自测标准 |
|---|---|---|---|---|
| 第一阶段 | 第 1~3 周 | 第一部分:K8s 入门与核心概念 | 理解架构,熟练使用 kubectl 管理常用对象 | 不看文档部署 Deployment+Service+Ingress 并排查 Pending/CrashLoopBackOff |
| 第二阶段 | 第 4~6 周 | 第二部分:K8s 进阶实战 | 掌握调度、存储、网络、安全、Helm/Kustomize | 独立配置 HPA、NetworkPolicy、RBAC,用 Helm/Kustomize 发布应用 |
| 第三阶段 | 第 7~9 周 | 第三部分:RKE2 精通 | 独立搭建和维护生产级 RKE2 集群 | 完成 3 server HA 集群搭建、etcd 快照恢复演练、版本升级 |
| 第四阶段 | 第 10~12 周 | 第四部分:辅助工具生态 | 建立完整工具箱,掌握 K8sGPT AI 诊断 | 用 k9s/K8sGPT/Trivy/Velero 完成一次完整巡检+备份演练 |
| 第五阶段 | 第 13~16 周 | 第五部分:综合实战 | 融会贯通,形成生产运维能力 | 独立完成四大综合实战,故障排查手册能对照实操 |
学习建议
- 动手为王:每章命令都在实验集群亲手敲一遍,故障案例刻意制造一次再修复。
- 实验环境:本地用 minikube/kind 练第一部分;用 2~3 台 VM 练 RKE2(可参考仓库
sz-rocky9-vm/与virsh/下的虚拟机脚本)。 - 善用仓库素材:本仓库
rke2/目录含真实安装脚本与配置,k8s-issues/目录含 RKE2 真实故障案例,教材相应章节均有引用,建议对照阅读。 - 工具逐步引入:不要一次装齐所有工具,按第四部分的"选型建议表"按需引入。
配套资源
- rke2/:RKE2 安装脚本与配置示例(server/agent config、registries.yaml)
- k8s-issues/:RKE2 生产故障案例(quorum 丢失、join 失败、镜像导入延迟等)
- k8s-service/textbook/:K8s Service 专题教材(网络部分深入阅读)
- metaLB/:MetalLB、CoreDNS、iptables/IPVS 专题教材
- job/K8s运维工程师零基础教材/、job/K8s运维工程师进阶教材/:更偏运维岗位体系的配套教材