主题
00 前言与学习建议
0.1 写给零基础学员的话
如果你从未接触过 GPU、AI 训练或 Kubernetes,不用担心。本教材从最基本的概念讲起——GPU 是什么、为什么 AI 需要 GPU、GPU 服务器长什么样——循序渐进,配合大量实例和实验,帮助你一步步掌握 GPU 集群运维工程师所需的核心技能。
GPU 集群运维工程师的核心价值在于:保障昂贵算力资源稳定、高效地被利用。一张 A100/H100 显卡价值数万到数十万元,一个千卡集群价值数亿元。让每一张卡健康运行、让每一个训练任务高效利用算力,就是你的工作。
0.2 为什么 GPU 运维是一个独立的技能方向
传统服务器运维关注 CPU、内存、磁盘、网络;GPU 集群运维在此基础上增加了:
- 硬件复杂度高:GPU 功耗大(单卡 300W~700W+)、发热大、故障模式特殊(XID 错误、掉卡、ECC 错误)
- 软件栈深:驱动 → CUDA → 容器工具链 → Device Plugin → 调度器,任何一层出问题都会影响业务
- 网络要求高:分布式训练依赖 RDMA/InfiniBand,网络抖动直接拖慢训练
- 资源昂贵:利用率每提升 10%,都是巨大的成本节约
0.3 本教材特点
- 零基础友好:从"GPU 是什么"开始讲起
- 体系完整:覆盖硬件、驱动、虚拟化、K8s 调度、网络、监控、故障、调优全链路
- 实践导向:每章包含实验、练习和真实故障案例
- 面试友好:附录包含常见面试题和参考答案
0.4 前置知识说明
本教材默认读者具备(或愿意同步学习)以下基础:
- Linux 基础:常用命令、systemd、软件包管理(不熟悉的读者建议先学习《K8s运维工程师零基础教材》第一、三部分)
- 容器基础:Docker 基本概念
- Kubernetes 基础:Pod、Deployment、节点管理等核心概念(第四部分会简要回顾,但建议系统学习)
0.5 实验环境搭建指南
方案一:纯理论学习环境(无 GPU)
即使没有任何 GPU,你依然可以完成本教材 60% 以上的学习内容:
- 概念、架构、原理全部可以学习
- K8s GPU 调度的 YAML 编写可以练习(Pod 会 Pending,但能验证调度逻辑)
- 监控体系可以用模拟数据搭建
方案二:单卡学习环境(推荐)
一张消费级 NVIDIA 显卡(GTX 1060 / RTX 3060 及以上)即可学习:
- 驱动安装、CUDA、容器工具链
- nvidia-smi 全部运维命令
- MPS、时间片共享(注意:MIG 仅支持 A100/H100 等数据中心卡)
- DCGM 监控(部分指标受限)
方案三:云上按量 GPU 实例
各大云厂商提供按小时计费的 GPU 实例(T4 约 1~2 元/小时起):
- 适合短期体验数据中心级 GPU(T4/A10/V100/A100)
- 多机实验可开 2 台实例练习 NCCL 通信
- 注意:实验完成后立即释放,避免产生高额费用
基础环境初始化
bash
# Ubuntu 22.04/24.04 基础工具
sudo apt update && sudo apt upgrade -y
sudo apt install -y vim git curl wget net-tools htop tree pciutils
# 查看是否有 NVIDIA 显卡
lspci | grep -i nvidia0.6 学习建议
- 建立"全栈视角":GPU 运维问题往往跨层——一个训练任务慢,可能是 GPU、驱动、NCCL、网络、存储任何一层的问题。
- 命令要形成肌肉记忆:
nvidia-smi的各种参数要练到不假思索。 - 案例驱动学习:第七部分的故障案例都来自生产实践,建议每个案例都动手复现思路。
- 记录自己的故障库:每遇到一个问题,记录"现象 → 排查过程 → 根因 → 解决方案"。
- 善用 AI 工具:把
nvidia-smi -q输出、XID 日志交给 Claude Code 等工具分析,是实际工作中的高效做法。
准备好了吗?让我们进入第一部分:GPU 与 AI 算力基础。