主题
GPU 集群运维零基础到精通系统教材
本教材面向零基础学员,系统讲解从 GPU 硬件与 AI 算力基础、驱动与环境搭建、GPU 虚拟化与共享、Kubernetes GPU 调度、高速网络与分布式训练、监控告警、故障诊断、性能调优到综合实战的完整知识体系,目标是培养能够独立运维大规模 GPU 算力集群的工程师。
一、教材定位
本教材旨在帮助零基础学员逐步成长为能够胜任以下工作的 GPU 集群运维工程师 / 算力平台工程师:
- GPU 服务器上架、驱动安装、环境初始化与交付
- Kubernetes GPU 集群的部署、调度、隔离与共享(Device Plugin、MIG、HAMi、Volcano)
- RDMA / InfiniBand / RoCE 高速网络与 NCCL 分布式训练环境保障
- GPU 监控告警体系建设(DCGM、Prometheus、Grafana)
- GPU 故障诊断与处理(XID 错误、掉卡、ECC 错误、NVLink 故障)
- GPU 利用率提升、混部、配额与成本优化
二、学习路线(建议 14~18 周)
| 阶段 | 周期 | 内容 | 目标 |
|---|---|---|---|
| 第一阶段 | 第 1~2 周 | GPU 与 AI 算力基础 | 理解 GPU 架构、CUDA 生态、训练/推理负载特征、算力指标 |
| 第二阶段 | 第 3~4 周 | GPU 服务器与驱动环境 | 独立完成驱动、CUDA、容器工具链安装与验证 |
| 第三阶段 | 第 5~6 周 | GPU 虚拟化与共享 | 掌握直通、vGPU、MIG、MPS、时间片共享的原理与配置 |
| 第四阶段 | 第 7~9 周 | Kubernetes GPU 调度 | 掌握 Device Plugin、GPU Operator、HAMi、Volcano 批调度 |
| 第五阶段 | 第 10~11 周 | 高速网络与分布式训练 | 理解 RDMA/IB/RoCE、NCCL、GPUDirect,会排查通信问题 |
| 第六阶段 | 第 12 周 | GPU 监控与可观测性 | 搭建 DCGM + Prometheus + Grafana 监控告警体系 |
| 第七阶段 | 第 13~14 周 | 故障诊断与运维实战 | 熟练处理 XID 错误、掉卡、ECC 错误等常见故障 |
| 第八阶段 | 第 15 周 | 性能调优与成本优化 | 掌握利用率分析、混部超卖、配额计费与成本核算 |
| 第九阶段 | 第 16~17 周 | 综合实战与面试 | 完成端到端 GPU 集群搭建实战,准备面试 |
| 第十阶段 | 第 18 周 | 复习与职业发展 | 查漏补缺,梳理知识体系 |
三、教材结构
GPU集群运维零基础到精通教材/
├── README.md # 本学习指南
├── 00-前言与学习建议.md # 学习方法和实验环境准备
├── 第一部分-GPU与AI算力基础.md # 第 1~4 章
├── 第二部分-GPU服务器与驱动环境.md # 第 5~8 章
├── 第三部分-GPU虚拟化与共享技术.md # 第 9~12 章
├── 第四部分-Kubernetes-GPU调度与管理.md # 第 13~17 章
├── 第五部分-高速网络与分布式训练.md # 第 18~21 章
├── 第六部分-GPU监控与可观测性.md # 第 22~24 章
├── 第七部分-GPU故障诊断与运维实战.md # 第 25~28 章
├── 第八部分-性能调优与成本优化.md # 第 29~31 章
├── 第九部分-综合实战与面试.md # 第 32~35 章
└── 附录.md # 命令速查、XID 错误码、面试题、参考资料四、实验环境建议
4.1 无 GPU 环境(学习前半部分足够)
- 一台安装 Ubuntu 22.04/24.04 的电脑或虚拟机(4 核 8GB 以上)
- 安装 Docker、kubectl、minikube 或 kind
- 大部分概念、YAML、监控体系均可通过模拟方式学习
4.2 有 GPU 环境(推荐)
- 一张 NVIDIA 显卡(GTX 1060 以上即可学习驱动、CUDA、容器、MPS)
- 云厂商按量 GPU 实例(如 T4/A10/A100,按小时计费,学完即释放)
- 有条件可申请体验 MIG(A100/H100)与多机 RDMA 环境
4.3 推荐工具
- 终端工具:Windows Terminal / Tabby / iTerm2
- 编辑器:VS Code + Remote-SSH 插件
- AI 工具:Claude Code、Codex、Cursor(辅助写脚本、排错)
五、学习方法
- 每天固定学习时间:建议每天至少 2 小时,周末 4~6 小时。
- 边学边练:每个知识点都要动手实验,尤其是
nvidia-smi、DCGM、K8s GPU 调度。 - 做笔记:用 Markdown 记录命令、报错和解决方案,建立自己的"故障案例库"。
- 理解原理再记命令:GPU 运维的核心是理解硬件、驱动、容器、调度之间的关系。
- 用 AI 提效:学会用 AI Agent 辅助查日志、写巡检脚本、分析 XID 错误。
六、学习成果检查清单
完成本教材学习后,你应该能够:
- [ ] 讲解 GPU 与 CPU 的区别、NVIDIA GPU 架构演进、CUDA 生态
- [ ] 独立完成 GPU 服务器驱动、CUDA Toolkit、NVIDIA Container Toolkit 安装与排错
- [ ] 区分直通、vGPU、MIG、MPS、时间片共享的适用场景并完成配置
- [ ] 在 Kubernetes 中部署 GPU Operator,调度 GPU 工作负载
- [ ] 使用 HAMi 等方案实现 GPU 显存切分与超卖
- [ ] 使用 Volcano 实现 AI 训练任务的 Gang Scheduling
- [ ] 讲解 RDMA、InfiniBand、RoCE、NCCL、GPUDirect 的工作原理
- [ ] 搭建 DCGM + Prometheus + Grafana GPU 监控告警体系
- [ ] 根据 XID 错误码定位并处理 GPU 故障(掉卡、ECC、过热等)
- [ ] 分析 GPU 利用率低的常见原因并给出优化方案
- [ ] 完成一个多节点 GPU 集群从裸机到可承载训练任务的端到端交付
七、参考资料
准备好了吗?让我们从 GPU 与 AI 算力基础 开始!