Skip to content

GPU 集群运维零基础到精通系统教材

本教材面向零基础学员,系统讲解从 GPU 硬件与 AI 算力基础、驱动与环境搭建、GPU 虚拟化与共享、Kubernetes GPU 调度、高速网络与分布式训练、监控告警、故障诊断、性能调优到综合实战的完整知识体系,目标是培养能够独立运维大规模 GPU 算力集群的工程师。


一、教材定位

本教材旨在帮助零基础学员逐步成长为能够胜任以下工作的 GPU 集群运维工程师 / 算力平台工程师

  • GPU 服务器上架、驱动安装、环境初始化与交付
  • Kubernetes GPU 集群的部署、调度、隔离与共享(Device Plugin、MIG、HAMi、Volcano)
  • RDMA / InfiniBand / RoCE 高速网络与 NCCL 分布式训练环境保障
  • GPU 监控告警体系建设(DCGM、Prometheus、Grafana)
  • GPU 故障诊断与处理(XID 错误、掉卡、ECC 错误、NVLink 故障)
  • GPU 利用率提升、混部、配额与成本优化

二、学习路线(建议 14~18 周)

阶段周期内容目标
第一阶段第 1~2 周GPU 与 AI 算力基础理解 GPU 架构、CUDA 生态、训练/推理负载特征、算力指标
第二阶段第 3~4 周GPU 服务器与驱动环境独立完成驱动、CUDA、容器工具链安装与验证
第三阶段第 5~6 周GPU 虚拟化与共享掌握直通、vGPU、MIG、MPS、时间片共享的原理与配置
第四阶段第 7~9 周Kubernetes GPU 调度掌握 Device Plugin、GPU Operator、HAMi、Volcano 批调度
第五阶段第 10~11 周高速网络与分布式训练理解 RDMA/IB/RoCE、NCCL、GPUDirect,会排查通信问题
第六阶段第 12 周GPU 监控与可观测性搭建 DCGM + Prometheus + Grafana 监控告警体系
第七阶段第 13~14 周故障诊断与运维实战熟练处理 XID 错误、掉卡、ECC 错误等常见故障
第八阶段第 15 周性能调优与成本优化掌握利用率分析、混部超卖、配额计费与成本核算
第九阶段第 16~17 周综合实战与面试完成端到端 GPU 集群搭建实战,准备面试
第十阶段第 18 周复习与职业发展查漏补缺,梳理知识体系

三、教材结构

GPU集群运维零基础到精通教材/
├── README.md                                # 本学习指南
├── 00-前言与学习建议.md                     # 学习方法和实验环境准备
├── 第一部分-GPU与AI算力基础.md              # 第 1~4 章
├── 第二部分-GPU服务器与驱动环境.md          # 第 5~8 章
├── 第三部分-GPU虚拟化与共享技术.md          # 第 9~12 章
├── 第四部分-Kubernetes-GPU调度与管理.md     # 第 13~17 章
├── 第五部分-高速网络与分布式训练.md         # 第 18~21 章
├── 第六部分-GPU监控与可观测性.md            # 第 22~24 章
├── 第七部分-GPU故障诊断与运维实战.md        # 第 25~28 章
├── 第八部分-性能调优与成本优化.md           # 第 29~31 章
├── 第九部分-综合实战与面试.md               # 第 32~35 章
└── 附录.md                                  # 命令速查、XID 错误码、面试题、参考资料

四、实验环境建议

4.1 无 GPU 环境(学习前半部分足够)

  • 一台安装 Ubuntu 22.04/24.04 的电脑或虚拟机(4 核 8GB 以上)
  • 安装 Docker、kubectl、minikube 或 kind
  • 大部分概念、YAML、监控体系均可通过模拟方式学习

4.2 有 GPU 环境(推荐)

  • 一张 NVIDIA 显卡(GTX 1060 以上即可学习驱动、CUDA、容器、MPS)
  • 云厂商按量 GPU 实例(如 T4/A10/A100,按小时计费,学完即释放)
  • 有条件可申请体验 MIG(A100/H100)与多机 RDMA 环境

4.3 推荐工具

  • 终端工具:Windows Terminal / Tabby / iTerm2
  • 编辑器:VS Code + Remote-SSH 插件
  • AI 工具:Claude Code、Codex、Cursor(辅助写脚本、排错)

五、学习方法

  1. 每天固定学习时间:建议每天至少 2 小时,周末 4~6 小时。
  2. 边学边练:每个知识点都要动手实验,尤其是 nvidia-smi、DCGM、K8s GPU 调度。
  3. 做笔记:用 Markdown 记录命令、报错和解决方案,建立自己的"故障案例库"。
  4. 理解原理再记命令:GPU 运维的核心是理解硬件、驱动、容器、调度之间的关系。
  5. 用 AI 提效:学会用 AI Agent 辅助查日志、写巡检脚本、分析 XID 错误。

六、学习成果检查清单

完成本教材学习后,你应该能够:

  • [ ] 讲解 GPU 与 CPU 的区别、NVIDIA GPU 架构演进、CUDA 生态
  • [ ] 独立完成 GPU 服务器驱动、CUDA Toolkit、NVIDIA Container Toolkit 安装与排错
  • [ ] 区分直通、vGPU、MIG、MPS、时间片共享的适用场景并完成配置
  • [ ] 在 Kubernetes 中部署 GPU Operator,调度 GPU 工作负载
  • [ ] 使用 HAMi 等方案实现 GPU 显存切分与超卖
  • [ ] 使用 Volcano 实现 AI 训练任务的 Gang Scheduling
  • [ ] 讲解 RDMA、InfiniBand、RoCE、NCCL、GPUDirect 的工作原理
  • [ ] 搭建 DCGM + Prometheus + Grafana GPU 监控告警体系
  • [ ] 根据 XID 错误码定位并处理 GPU 故障(掉卡、ECC、过热等)
  • [ ] 分析 GPU 利用率低的常见原因并给出优化方案
  • [ ] 完成一个多节点 GPU 集群从裸机到可承载训练任务的端到端交付

七、参考资料


准备好了吗?让我们从 GPU 与 AI 算力基础 开始!