Skip to content

00 前言与学习建议

本教材以"Kubernetes 核心 → RKE2 生产部署 → 辅助工具生态 → 综合实战"为主线,帮助运维工程师从零基础成长为能独立规划、部署、运维生产级 K8s 集群的工程师。


为什么写这套教材

市面上的 K8s 资料有两个常见问题:

  1. 只讲 K8s,不讲发行版:学了半天 Deployment 和 Service,到了生产环境面对 RKE2、OpenShift、Kubeadm 依然无从下手。
  2. 只讲主菜,不讲工具:真正的运维效率差距,往往体现在 k9s、K8sGPT、Velero、Trivy 这些辅助工具的掌握程度上。

本教材把三者串成一条完整链路:Kubernetes(内核)→ RKE2(落地)→ 工具生态(效率),并以综合实战与故障排查手册收尾。

为什么是 RKE2

RKE2(Rancher Kubernetes Engine 2)是 Rancher 推出的企业级 K8s 发行版,特点是:

  • 安全合规:默认 CIS 加固,支持 SELinux、FIPS 140-2
  • 运维简单:单一二进制 + systemd 管理,控制平面以静态 Pod 运行
  • 生产就绪:内置 etcd 快照、证书轮换、system-upgrade-controller 自动升级
  • 国内友好:支持 INSTALL_RKE2_MIRROR=cn 国内镜像源

对于运维团队而言,RKE2 在"易用性"与"可控性"之间取得了很好的平衡,是本教材选择的落地发行版。

为什么重点讲 K8sGPT

AI 辅助运维是近两年 K8s 生态最重要的变化之一。K8sGPT 将 SRE 经验编码为分析器(analyzer),自动扫描集群问题,并可接入 OpenAI / Ollama 等大模型给出人话解释与修复建议。它能:

  • ImagePullBackOffPendingCrashLoopBackOff 等问题的定位从"半小时翻日志"缩短到"一条命令"
  • 通过 anonymize 脱敏后接入云端大模型,或在离线环境用 Ollama 本地模型
  • 与 Trivy、Prometheus 集成,形成"监控 → 告警 → AI 诊断"闭环

第四部分对 K8sGPT 做了全书最深的专题讲解。

学习方法

  1. 三遍学习法
    • 第一遍通读,建立知识地图(知道有什么);
    • 第二遍动手,每条命令在实验集群执行(知道怎么用);
    • 第三遍输出,给同事讲一遍或写笔记(真正掌握)。
  2. 故障驱动:第三、五部分的故障案例,建议在实验环境刻意制造故障再修复——排错能力只能练出来。
  3. 版本意识:K8s 每 4 个月一个版本,教材基于 v1.28+;执行命令前先 kubectl version 确认,注意 API 版本变化。
  4. 最小必要原则:工具不是装得越多越好。第四部分每个工具都给了"适用场景",按需引入。

实验环境准备

环境用途最低配置
本机 minikube / kind第一、二部分练习2C4G
2~3 台 VM(Rocky Linux 9 / Ubuntu 22.04)RKE2 单节点与 HA 练习每台 2C4G、20G 磁盘
(可选)6 台 VM第五部分生产级综合实战每台 2C4G

提示:本仓库 sz-rocky9-vm/virsh/ 目录提供了批量创建 KVM 虚拟机的脚本,可用于快速准备实验环境。

配套仓库资源

  • rke2/:安装脚本、server-config.yamlagent-config.yamlregistries.yaml 真实示例
  • k8s-issues/:RKE2 生产故障案例(控制平面 quorum 丢失、防火墙阻断 join、镜像导入延迟等),教材中大量引用
  • k8s-service/textbook/metaLB/:网络专题深入阅读

现在,从 第一部分 Kubernetes 入门与核心概念 开始。