主题
K8s运维工程师零基础系统教材
本教材基于 K8s运维工程师 职位能力模型(JD)设计,面向零基础学员,系统讲解从 Linux 基础、云计算、容器技术、Kubernetes 运维、可观测性、自动化运维到 AI Agent 辅助运维的完整知识体系。
一、教材定位
本教材旨在帮助零基础学员逐步成长为能够胜任以下工作的 Kubernetes 运维工程师:
- 混合云环境下 Kubernetes 集群和云资源的日常运维
- 算力平台运行环境保障,支持大量 Agent 任务在 CPU/内存资源池中稳定运行
- 监控、告警、日志和可观测体系建设
- 运维自动化和平台化建设
- 熟练使用 Claude Code、Codex 等 AI Agent 工具辅助运维
二、学习路线(建议 12~16 周)
| 阶段 | 周期 | 内容 | 目标 |
|---|---|---|---|
| 第一阶段 | 第 1~2 周 | Linux 基础与运维入门 | 熟练使用 Linux,能排查 CPU、内存、磁盘、网络、进程等常见问题 |
| 第二阶段 | 第 3 周 | 云计算基础 | 理解混合云架构,熟悉云主机、VPC、安全组、负载均衡、存储等产品 |
| 第三阶段 | 第 4 周 | 容器技术基础 | 掌握 Docker 镜像、容器、网络、存储 |
| 第四阶段 | 第 5~7 周 | Kubernetes 核心基础 | 掌握 K8s 核心对象、工作负载、服务发现、存储、RBAC |
| 第五阶段 | 第 8~9 周 | Kubernetes 集群运维 | 掌握集群部署、升级、巡检、扩容、故障排查 |
| 第六阶段 | 第 10 周 | 可观测性体系 | 掌握 Prometheus、Grafana、Alertmanager、Loki/ELK |
| 第七阶段 | 第 11 周 | 运维自动化与平台化 | 掌握 Shell/Python/Go 脚本、自动巡检、弹性伸缩、故障自愈 |
| 第八阶段 | 第 12 周 | AI Agent 辅助运维 | 熟练使用 Claude Code、Codex 提升运维效率 |
| 第九阶段 | 第 13~14 周 | 算力平台与综合实战 | 理解算力平台架构,完成综合项目 |
| 第十阶段 | 第 15~16 周 | 复习、面试与职业发展 | 查漏补缺,准备面试 |
三、教材结构
K8s运维工程师零基础教材/
├── README.md # 本学习指南
├── 00-前言与学习建议.md # 学习方法和实验环境准备
├── 第一部分-Linux基础与运维入门.md # 第 1~4 章
├── 第二部分-云计算基础.md # 第 5~7 章
├── 第三部分-容器技术基础.md # 第 8~10 章
├── 第四部分-Kubernetes核心基础.md # 第 11~16 章
├── 第五部分-Kubernetes集群运维.md # 第 17~20 章
├── 第六部分-可观测性体系.md # 第 21~24 章
├── 第七部分-运维自动化与平台化.md # 第 25~29 章
├── 第八部分-AI-Agent辅助运维.md # 第 30~32 章
├── 第九部分-算力平台与综合实战.md # 第 33~36 章
└── 附录.md # 常用命令、面试题、参考资料四、实验环境建议
4.1 最小实验环境
- 一台安装 Ubuntu 22.04/24.04 的电脑或虚拟机(建议 4 核 8GB 内存以上)
- 安装 Docker、kubectl、minikube 或 kind
- 一个云厂商免费账号(阿里云、腾讯云、AWS、Azure 等,用于体验云产品)
4.2 推荐工具
- 终端工具:iTerm2 / Windows Terminal / Tabby
- 编辑器:VS Code + Remote-SSH 插件
- 版本控制:Git + GitHub/GitLab
- AI 工具:Claude Code、GitHub Copilot、Cursor
五、学习方法
- 每天固定学习时间:建议每天至少 2 小时,周末 4~6 小时。
- 边学边练:每个知识点都要动手实验,不要只看不练。
- 做笔记:使用 Markdown 记录学习心得、命令、报错和解决方案。
- 建立错题本:记录排查过的问题和解决思路。
- 参与社区:遇到问题先搜索,再提问(Stack Overflow、GitHub Issues、掘金、知乎)。
- 用 AI 提效:学会用 Claude Code、Codex 等工具辅助学习、写脚本、排错。
六、学习成果检查清单
完成本教材学习后,你应该能够:
- [ ] 熟练使用 Linux 常用命令,独立排查系统问题
- [ ] 理解混合云架构,能在云上部署 VPC、虚拟机、负载均衡、存储
- [ ] 熟练使用 Docker 构建镜像、管理容器
- [ ] 理解 Kubernetes 架构,熟练编写 YAML 资源清单
- [ ] 部署、升级、巡检 Kubernetes 集群
- [ ] 排查 Pod Pending、CrashLoopBackOff、OOMKilled、节点 NotReady 等常见问题
- [ ] 搭建 Prometheus + Grafana + Alertmanager 监控告警体系
- [ ] 部署 Loki 或 ELK 日志系统
- [ ] 编写 Shell/Python/Go 自动化脚本
- [ ] 使用 AI Agent 工具辅助运维脚本开发、故障分析和文档沉淀
- [ ] 理解算力平台和 Agent 任务调度场景
七、参考资料
准备好了吗?让我们从 Linux 基础 开始!