Skip to content

K8s运维工程师进阶教材

本教材面向已掌握 K8s 基础的运维工程师,深入讲解生产环境中的高级运维技术,包括网络原理、高级调度、CSI 存储、安全加固、多集群管理、GitOps、可观测性、混沌工程、性能调优和大规模运维实践。


前置要求

学习本教材前,建议已经:

  • 熟练使用 Linux 系统管理和故障排查
  • 掌握 Docker 容器技术
  • 掌握 Kubernetes 核心对象和基本运维
  • 能部署 Prometheus + Grafana 监控系统
  • 具备 Shell/Python/Go 至少一种脚本能力

如果以上基础不牢固,请先学习《K8s运维工程师零基础教材》。


学习路线(建议 10~14 周)

阶段周期内容目标
第一阶段第 1~2 周K8s 网络进阶理解 CNI、Service 实现、DNS、Ingress 控制器原理
第二阶段第 3 周高级调度与资源管理掌握亲和性、污点、优先级抢占、自定义调度器
第三阶段第 4 周存储与 CSI 进阶理解 CSI、Rook/Ceph、快照、扩容
第四阶段第 5 周K8s 安全进阶掌握 Pod 安全、NetworkPolicy、RBAC 深度、OPA/Gatekeeper
第五阶段第 6~7 周多集群与 GitOps掌握 Karmada/Cluster API、ArgoCD/Flux
第六阶段第 8~9 周高级可观测性掌握 Thanos/VictoriaMetrics、链路追踪、eBPF 监控
第七阶段第 10 周混沌工程与容量规划掌握 Chaos Engineering、容量管理、成本优化
第八阶段第 11 周性能调优与大规模运维掌握集群性能优化、etcd 调优、大规模集群运维
第九阶段第 12~14 周综合实战与面试进阶完成生产级项目,准备高级面试

教材结构

K8s运维工程师进阶教材/
├── README.md                          # 本学习指南
├── 00-前言与学习建议.md               # 进阶学习方法和环境准备
├── 第一部分-K8s网络进阶.md             # CNI、Service 实现、CoreDNS、Ingress
├── 第二部分-高级调度与资源管理.md       # 亲和性、污点、优先级、自定义调度器
├── 第三部分-存储与CSI进阶.md           # CSI、Rook/Ceph、快照、扩容
├── 第四部分-K8s安全进阶.md             # PSA、NetworkPolicy、Secret 加密、OPA
├── 第五部分-多集群与GitOps.md          # Karmada、Cluster API、ArgoCD、Flux
├── 第六部分-高级可观测性.md             # Thanos、VictoriaMetrics、Jaeger、eBPF
├── 第七部分-混沌工程与容量规划.md       # Chaos Engineering、容量规划、成本优化
├── 第八部分-性能调优与大规模运维.md     # etcd 调优、API Server 优化、大规模运维
└── 第九部分-综合实战与面试进阶.md       # 生产级项目、高级面试题

实验环境建议

最小环境

  • 3 台以上虚拟机或云服务器(2 核 4GB 起步)
  • 已部署 K8s 集群(kubeadm 或托管 K8s)
  • 安装 Helm、kubectl、Docker
  • 一个 Git 仓库

推荐工具

  • CNI:Calico 或 Cilium
  • 存储:Rook-Ceph 或 OpenEBS
  • GitOps:ArgoCD
  • 可观测性:VictoriaMetrics + Grafana + Loki + Tempo
  • 混沌工程:Chaos Mesh

学习成果检查清单

完成本教材学习后,你应该能够:

  • [ ] 深入理解 K8s 网络模型和 CNI 实现
  • [ ] 排查复杂的 Service、DNS、Ingress 问题
  • [ ] 设计高级调度策略(亲和性、污点、优先级)
  • [ ] 部署和管理 CSI 存储系统
  • [ ] 加固 K8s 集群安全(PSA、NetworkPolicy、OPA)
  • [ ] 管理多集群和使用 GitOps 交付应用
  • [ ] 构建企业级可观测性平台
  • [ ] 实施混沌工程和容量规划
  • [ ] 调优大规模 K8s 集群性能
  • [ ] 胜任高级 K8s 运维/SRE 岗位

参考资料


准备好了吗?让我们进入 K8s 运维的深水区!