Skip to content

00 前言与学习建议

0.1 写给零基础学员的话

如果你从未接触过 GPU、AI 训练或 Kubernetes,不用担心。本教材从最基本的概念讲起——GPU 是什么、为什么 AI 需要 GPU、GPU 服务器长什么样——循序渐进,配合大量实例和实验,帮助你一步步掌握 GPU 集群运维工程师所需的核心技能。

GPU 集群运维工程师的核心价值在于:保障昂贵算力资源稳定、高效地被利用。一张 A100/H100 显卡价值数万到数十万元,一个千卡集群价值数亿元。让每一张卡健康运行、让每一个训练任务高效利用算力,就是你的工作。

0.2 为什么 GPU 运维是一个独立的技能方向

传统服务器运维关注 CPU、内存、磁盘、网络;GPU 集群运维在此基础上增加了:

  • 硬件复杂度高:GPU 功耗大(单卡 300W~700W+)、发热大、故障模式特殊(XID 错误、掉卡、ECC 错误)
  • 软件栈深:驱动 → CUDA → 容器工具链 → Device Plugin → 调度器,任何一层出问题都会影响业务
  • 网络要求高:分布式训练依赖 RDMA/InfiniBand,网络抖动直接拖慢训练
  • 资源昂贵:利用率每提升 10%,都是巨大的成本节约

0.3 本教材特点

  • 零基础友好:从"GPU 是什么"开始讲起
  • 体系完整:覆盖硬件、驱动、虚拟化、K8s 调度、网络、监控、故障、调优全链路
  • 实践导向:每章包含实验、练习和真实故障案例
  • 面试友好:附录包含常见面试题和参考答案

0.4 前置知识说明

本教材默认读者具备(或愿意同步学习)以下基础:

  • Linux 基础:常用命令、systemd、软件包管理(不熟悉的读者建议先学习《K8s运维工程师零基础教材》第一、三部分)
  • 容器基础:Docker 基本概念
  • Kubernetes 基础:Pod、Deployment、节点管理等核心概念(第四部分会简要回顾,但建议系统学习)

0.5 实验环境搭建指南

方案一:纯理论学习环境(无 GPU)

即使没有任何 GPU,你依然可以完成本教材 60% 以上的学习内容:

  • 概念、架构、原理全部可以学习
  • K8s GPU 调度的 YAML 编写可以练习(Pod 会 Pending,但能验证调度逻辑)
  • 监控体系可以用模拟数据搭建

方案二:单卡学习环境(推荐)

一张消费级 NVIDIA 显卡(GTX 1060 / RTX 3060 及以上)即可学习:

  • 驱动安装、CUDA、容器工具链
  • nvidia-smi 全部运维命令
  • MPS、时间片共享(注意:MIG 仅支持 A100/H100 等数据中心卡)
  • DCGM 监控(部分指标受限)

方案三:云上按量 GPU 实例

各大云厂商提供按小时计费的 GPU 实例(T4 约 1~2 元/小时起):

  • 适合短期体验数据中心级 GPU(T4/A10/V100/A100)
  • 多机实验可开 2 台实例练习 NCCL 通信
  • 注意:实验完成后立即释放,避免产生高额费用

基础环境初始化

bash
# Ubuntu 22.04/24.04 基础工具
sudo apt update && sudo apt upgrade -y
sudo apt install -y vim git curl wget net-tools htop tree pciutils

# 查看是否有 NVIDIA 显卡
lspci | grep -i nvidia

0.6 学习建议

  1. 建立"全栈视角":GPU 运维问题往往跨层——一个训练任务慢,可能是 GPU、驱动、NCCL、网络、存储任何一层的问题。
  2. 命令要形成肌肉记忆nvidia-smi 的各种参数要练到不假思索。
  3. 案例驱动学习:第七部分的故障案例都来自生产实践,建议每个案例都动手复现思路。
  4. 记录自己的故障库:每遇到一个问题,记录"现象 → 排查过程 → 根因 → 解决方案"。
  5. 善用 AI 工具:把 nvidia-smi -q 输出、XID 日志交给 Claude Code 等工具分析,是实际工作中的高效做法。

准备好了吗?让我们进入第一部分:GPU 与 AI 算力基础