Skip to content

K8s运维工程师零基础系统教材

本教材基于 K8s运维工程师 职位能力模型(JD)设计,面向零基础学员,系统讲解从 Linux 基础、云计算、容器技术、Kubernetes 运维、可观测性、自动化运维到 AI Agent 辅助运维的完整知识体系。


一、教材定位

本教材旨在帮助零基础学员逐步成长为能够胜任以下工作的 Kubernetes 运维工程师

  • 混合云环境下 Kubernetes 集群和云资源的日常运维
  • 算力平台运行环境保障,支持大量 Agent 任务在 CPU/内存资源池中稳定运行
  • 监控、告警、日志和可观测体系建设
  • 运维自动化和平台化建设
  • 熟练使用 Claude Code、Codex 等 AI Agent 工具辅助运维

二、学习路线(建议 12~16 周)

阶段周期内容目标
第一阶段第 1~2 周Linux 基础与运维入门熟练使用 Linux,能排查 CPU、内存、磁盘、网络、进程等常见问题
第二阶段第 3 周云计算基础理解混合云架构,熟悉云主机、VPC、安全组、负载均衡、存储等产品
第三阶段第 4 周容器技术基础掌握 Docker 镜像、容器、网络、存储
第四阶段第 5~7 周Kubernetes 核心基础掌握 K8s 核心对象、工作负载、服务发现、存储、RBAC
第五阶段第 8~9 周Kubernetes 集群运维掌握集群部署、升级、巡检、扩容、故障排查
第六阶段第 10 周可观测性体系掌握 Prometheus、Grafana、Alertmanager、Loki/ELK
第七阶段第 11 周运维自动化与平台化掌握 Shell/Python/Go 脚本、自动巡检、弹性伸缩、故障自愈
第八阶段第 12 周AI Agent 辅助运维熟练使用 Claude Code、Codex 提升运维效率
第九阶段第 13~14 周算力平台与综合实战理解算力平台架构,完成综合项目
第十阶段第 15~16 周复习、面试与职业发展查漏补缺,准备面试

三、教材结构

K8s运维工程师零基础教材/
├── README.md                          # 本学习指南
├── 00-前言与学习建议.md               # 学习方法和实验环境准备
├── 第一部分-Linux基础与运维入门.md     # 第 1~4 章
├── 第二部分-云计算基础.md             # 第 5~7 章
├── 第三部分-容器技术基础.md           # 第 8~10 章
├── 第四部分-Kubernetes核心基础.md     # 第 11~16 章
├── 第五部分-Kubernetes集群运维.md     # 第 17~20 章
├── 第六部分-可观测性体系.md           # 第 21~24 章
├── 第七部分-运维自动化与平台化.md     # 第 25~29 章
├── 第八部分-AI-Agent辅助运维.md       # 第 30~32 章
├── 第九部分-算力平台与综合实战.md     # 第 33~36 章
└── 附录.md                            # 常用命令、面试题、参考资料

四、实验环境建议

4.1 最小实验环境

  • 一台安装 Ubuntu 22.04/24.04 的电脑或虚拟机(建议 4 核 8GB 内存以上)
  • 安装 Docker、kubectl、minikube 或 kind
  • 一个云厂商免费账号(阿里云、腾讯云、AWS、Azure 等,用于体验云产品)

4.2 推荐工具

  • 终端工具:iTerm2 / Windows Terminal / Tabby
  • 编辑器:VS Code + Remote-SSH 插件
  • 版本控制:Git + GitHub/GitLab
  • AI 工具:Claude Code、GitHub Copilot、Cursor

五、学习方法

  1. 每天固定学习时间:建议每天至少 2 小时,周末 4~6 小时。
  2. 边学边练:每个知识点都要动手实验,不要只看不练。
  3. 做笔记:使用 Markdown 记录学习心得、命令、报错和解决方案。
  4. 建立错题本:记录排查过的问题和解决思路。
  5. 参与社区:遇到问题先搜索,再提问(Stack Overflow、GitHub Issues、掘金、知乎)。
  6. 用 AI 提效:学会用 Claude Code、Codex 等工具辅助学习、写脚本、排错。

六、学习成果检查清单

完成本教材学习后,你应该能够:

  • [ ] 熟练使用 Linux 常用命令,独立排查系统问题
  • [ ] 理解混合云架构,能在云上部署 VPC、虚拟机、负载均衡、存储
  • [ ] 熟练使用 Docker 构建镜像、管理容器
  • [ ] 理解 Kubernetes 架构,熟练编写 YAML 资源清单
  • [ ] 部署、升级、巡检 Kubernetes 集群
  • [ ] 排查 Pod Pending、CrashLoopBackOff、OOMKilled、节点 NotReady 等常见问题
  • [ ] 搭建 Prometheus + Grafana + Alertmanager 监控告警体系
  • [ ] 部署 Loki 或 ELK 日志系统
  • [ ] 编写 Shell/Python/Go 自动化脚本
  • [ ] 使用 AI Agent 工具辅助运维脚本开发、故障分析和文档沉淀
  • [ ] 理解算力平台和 Agent 任务调度场景

七、参考资料


准备好了吗?让我们从 Linux 基础 开始!