Skip to content

Kubernetes + RKE2 + K8s 辅助工具:从入门到精通

一套面向运维工程师的系统性教材:从 Kubernetes 零基础入门,到 RKE2 生产级集群部署运维,再到 k9s、K8sGPT、Velero、ArgoCD 等辅助工具生态,最后以综合实战与故障排查手册收尾。


适用读者

  • 有一定 Linux 基础、想系统学习 Kubernetes 的运维工程师
  • 需要在生产环境部署、维护 RKE2 集群的工程师
  • 希望掌握 K8s 周边工具链(尤其是 AI 辅助诊断 K8sGPT)提升运维效率的工程师
  • 准备 CKA / CKS 认证或云原生面试的工程师

前置要求

  • 熟悉 Linux 基本操作(systemd、网络、防火墙、存储)
  • 了解 Docker / containerd 容器基本概念
  • 有一台可实验的 Linux 机器或虚拟机(推荐 Rocky Linux 9 / Ubuntu 22.04,2C4G 以上)

教材结构

部分文件内容
前言00-前言与学习建议.md教材定位、学习方法、实验环境准备
第一部分第一部分-Kubernetes入门与核心概念.mdK8s 架构、kubectl 精通、工作负载、ConfigMap/Secret、Service、存储入门、命名空间与配额、排错入门
第二部分第二部分-Kubernetes进阶实战.md调度、资源管理(HPA/VPA/KEDA)、存储进阶(CSI/快照)、网络进阶(IPVS/CoreDNS/Ingress/NetworkPolicy)、安全(RBAC/PSS)、可观测性、Helm 与 Kustomize
第三部分第三部分-RKE2从入门到精通.mdRKE2 架构与对比、安装、HA 部署、config.yaml 详解、registries.yaml、etcd 备份恢复、升级与证书轮换、内置组件与 HelmChart CRD、CIS 安全加固、故障排查大全
第四部分第四部分-K8s辅助工具生态.md终端效率工具(k9s/kubectx/stern/krew)、可视化管理(Lens/Headlamp/Rancher)、AI 辅助诊断 K8sGPT(重点)、健康审计(Popeye/kube-score)、安全扫描(Trivy/kube-bench/Falco)、备份迁移(Velero)、GitOps(ArgoCD/Flux)、成本容量(OpenCost/Goldilocks)、网络流量工具(kubeshark/eBPF)、本地调试(Telepresence/kubectl debug)
第五部分第五部分-综合实战与故障排查手册.md生产级 RKE2 HA 集群搭建、监控告警→AI 诊断闭环、GitOps 流水线、备份灾难恢复演练、全栈故障排查速查手册
附录附录-命令速查与资源.mdkubectl / RKE2 / 辅助工具速查表、YAML 模板、认证与学习资源

学习路线(建议 12~16 周)

阶段周期内容目标自测标准
第一阶段第 1~3 周第一部分:K8s 入门与核心概念理解架构,熟练使用 kubectl 管理常用对象不看文档部署 Deployment+Service+Ingress 并排查 Pending/CrashLoopBackOff
第二阶段第 4~6 周第二部分:K8s 进阶实战掌握调度、存储、网络、安全、Helm/Kustomize独立配置 HPA、NetworkPolicy、RBAC,用 Helm/Kustomize 发布应用
第三阶段第 7~9 周第三部分:RKE2 精通独立搭建和维护生产级 RKE2 集群完成 3 server HA 集群搭建、etcd 快照恢复演练、版本升级
第四阶段第 10~12 周第四部分:辅助工具生态建立完整工具箱,掌握 K8sGPT AI 诊断用 k9s/K8sGPT/Trivy/Velero 完成一次完整巡检+备份演练
第五阶段第 13~16 周第五部分:综合实战融会贯通,形成生产运维能力独立完成四大综合实战,故障排查手册能对照实操

学习建议

  1. 动手为王:每章命令都在实验集群亲手敲一遍,故障案例刻意制造一次再修复。
  2. 实验环境:本地用 minikube/kind 练第一部分;用 2~3 台 VM 练 RKE2(可参考仓库 sz-rocky9-vm/virsh/ 下的虚拟机脚本)。
  3. 善用仓库素材:本仓库 rke2/ 目录含真实安装脚本与配置,k8s-issues/ 目录含 RKE2 真实故障案例,教材相应章节均有引用,建议对照阅读。
  4. 工具逐步引入:不要一次装齐所有工具,按第四部分的"选型建议表"按需引入。

配套资源