主题
零基础到大模型精通 —— 第三阶段:进阶原理大纲
前置要求:完成第二阶段(应用实战),具备独立交付 AI 应用的能力。 阶段目标:6~10 周内深入大模型"为什么"的层面——预训练工程、先进架构(MoE/长上下文)、对齐技术(RLHF/DPO)、多模态,达到"能读论文、能复现、能做架构决策"的水平,为底层性能优化阶段储备原理弹药。
模块 13:预训练全流程工程(2~3 周)⭐ 重点模块
13.1 数据工程
- 预训练语料的构成:网页(Common Crawl)、书籍、代码、论文、多语言
- 数据清洗管线:去重(MinHash/SimHash)、质量过滤(分类器打分)、去 PII、去污染(与评测集重叠检测)
- 数据配比(Data Mixture):领域配比实验、课程式配比、退火阶段(annealing)的高质量数据
- Tokenizer 训练:BPE 压缩率、词表大小对多语言/代码的影响
- 数据规模估算:Chinchilla 最优数据量(tokens ≈ 20 × 参数量)及其后续修正
13.2 训练工程
- 训练目标变体:NTP、FIM(Fill-in-the-Middle)、UL2 扫盲
- 超参数体系:学习率(warmup、cosine/linear decay、WSD schedule)、batch size 爬坡、序列长度课程(4K → 32K → 128K)
- µP(Maximal Update Parametrization):超参数跨规模迁移的直觉
- 稳定性工程:loss spike 的成因与应对(梯度裁剪、checkpoint 回滚、数据跳批)
- 训练可观测性:loss 曲线、梯度范数、学习率、吞吐(tokens/GPU/s)、MFU(算力利用率)
13.3 分布式训练原理(精通阶段的预备)
- 数据并行(DP)与梯度同步
- 张量并行(TP):切什么、通信在哪(all-reduce)
- 流水线并行(PP):气泡问题、1F1B 调度
- ZeRO 三部曲:优化器状态 / 梯度 / 参数分片
- 混合精度训练:BF16 前向 + FP32 主权重、loss scaling(FP16 时代)
- 3D 并行的组合策略与通信拓扑(NVLink / IB)
13.4 Scaling Law 与训练决策
- Kaplan vs Chinchilla Scaling Law:公式与含义
- 如何用 Scaling Law 做训练前预算(参数量、数据量、算力、时长的换算)
- Loss 预测与训练中途的"要不要继续训"决策
实战:
- 用 Megatron-LM 或 nanotron 在单机多卡上跑通一个 100M~500M 模型的预训练(TinyStories/Fineweb 子集)
- 复现一个小规模 Scaling Law 实验:3 个不同尺寸模型的 loss-算力曲线拟合
- 计算并优化一次训练的 MFU:测吞吐、算理论峰值、找瓶颈
模块 14:先进架构专题(2~3 周)⭐ 重点模块
14.1 MoE(混合专家)
- 稀疏激活原理:Top-K 路由、专家容量(capacity factor)
- 负载均衡:辅助损失(auxiliary loss)vs 无辅助损失策略(DeepSeek-V3 的 bias 方案)
- 共享专家 + 细粒度专家(Fine-grained Experts)
- 训练挑战:路由崩塌、专家并行(EP)通信开销
- 推理挑战:显存装全参数、计算只激活部分 → 显存-算力解耦
- 案例精读:Mixtral 8x7B、DeepSeek-V3/R1(671B/37B 激活)、Qwen3-235B-A22B
14.2 注意力架构演进
- MHA → MQA → GQA → MLA(Multi-head Latent Attention,DeepSeek 的低秩 KV 压缩)
- 注意力复杂度问题与稀疏注意力:Sliding Window、NSA/DSA 扫盲
- 线性注意力与状态空间模型:Mamba/RWKV 思路与适用边界
14.3 长上下文技术
- RoPE 外推问题:为什么直接外推会崩
- 位置插值(PI)、NTK-aware、YaRN 的原理差异
- 上下文扩展训练:短训长测 vs 长文续训
- 长上下文的系统代价:KV Cache 爆炸、注意力计算量、RULER/NIAH 评测
14.4 架构论文精读法
- 精读清单:LLaMA 2/3、Qwen2.5/3 技术报告、DeepSeek-V2/V3、Mixtral、Gemma
- 方法论:如何读技术报告(架构表 → 训练配方 → 消融实验 → 数据描述)
实战:
- 手算并验证:同一 hidden size 下,MHA / GQA-8 / MLA 的 KV Cache 显存差异
- 用 YaRN 将一个 8K 上下文模型扩展到 32K,并用大海捞针(NIAH)测试验证
- 阅读 DeepSeek-V3 技术报告,输出一份架构要点拆解笔记(MoE + MLA + 训练工程)
模块 15:对齐技术(Alignment)(2~3 周)⭐ 重点模块
15.1 RLHF 经典管线
- 三步曲:SFT → 奖励模型(RM)→ PPO
- Bradley-Terry 偏好建模与 RM 训练
- PPO 细节:KL 惩罚、价值网络、优势估计、reward hacking 问题
- RLHF 的工程痛点:四个模型同时在场的显存与调度(RLHF 框架为什么复杂)
15.2 免 RL 的对齐方法
- DPO:从 BT 模型直接推导的策略优化、与 PPO 的效果对比
- 变体家族:IPO、KTO、ORPO、SimPO——各自解决什么问题
- GRPO:DeepSeek-R1 采用的组相对策略优化,为什么省掉价值网络
- 在线 vs 离线偏好优化
15.3 推理能力对齐(Reasoning)
- RLVR(可验证奖励强化学习):数学/代码任务上的自动判分
- 长思维链(Long CoT)的涌现:aha moment、长度膨胀与过度思考
- R1 式训练配方:冷启动 SFT → RL → 拒绝采样 → 全场景 SFT
- 蒸馏小模型的 reasoning 能力迁移
15.4 安全对齐
- 有害请求拒答、红队测试(Red Teaming)
- 宪法 AI(Constitutional AI)思路
- 越狱攻防与评估基准
实战:
- 用 TRL 对 1.5B 模型跑通完整 DPO:构造偏好对 → 训练 → 前后对比
- 复现微型 GRPO:在 GSM8K 上用规则判分器训练小模型,观察推理链变化
- 对同一 SFT 模型分别做 DPO / KTO,设计实验对比胜率与副作用(如长度漂移)
模块 16:多模态大模型(1~2 周)
16.1 视觉语言模型(VLM)
- 架构范式:视觉编码器(ViT/SigLIP)+ 投影层 + LLM
- LLaVA 管线:两阶段训练(对齐投影层 → 指令微调)
- 高分辨率处理:动态切图、视觉 token 压缩
- Qwen2-VL/Qwen2.5-VL 的架构要点(NaViT、MRoPE)
16.2 其他模态
- 音频模型:Whisper 编码器 + LLM、语音对话(端到端 vs 级联)
- 视频理解:帧采样策略与时序建模
- 统一多模态:理解与生成一体化(any-to-any 扫盲)
16.3 图像生成侧(了解即可)
- 扩散模型原理 10 分钟版:加噪与去噪
- 文生图管线:CLIP/DiT/SD3 的概念位置
实战:
- 用 vLLM 部署 Qwen2.5-VL,完成文档图片问答与表格识别
- 构造 500 条领域 VQA 数据,微调 VLM 并对比基线
模块 17:评测与科学实验方法(1 周)
17.1 评测体系
- 通用基准:MMLU / C-Eval / GSM8K / HumanEval / MMLU-Pro 的适用性与污染问题
- 推理基准:AIME、GPQA、LiveCodeBench
- 开放生成评估:MT-Bench、Arena(ELO)、LLM-as-a-Judge 的偏差(位置偏好、长度偏好、自我偏好)
- 评测基础设施:lm-evaluation-harness、OpenCompass
17.2 实验方法论
- 消融实验(Ablation)设计:控制变量
- 统计显著性:多次运行、方差、Bootstrap
- 如何避免"评测过拟合":留出私有评测集
- 技术报告阅读与批判性复现
实战:为一个垂直模型设计完整评测方案(公开基准 + 自建黄金集 + LLM-Judge + 人工抽检),并对两轮模型迭代做显著性分析。
模块 18:进阶阶段综合项目(2 周)
项目:从 0 到 1 复刻一条"迷你 R1"管线
- 选一个 1.5B~4B 基座模型
- 收集/合成数学推理数据,冷启动 SFT
- 用 GRPO 做 RL 训练(规则判分),追踪 pass@1 与思维链长度曲线
- 蒸馏对比:直接用 R1 蒸馏数据 SFT vs 自己的 RL 结果
- 完整评测:GSM8K / MATH / 自建集 + 显著性分析
- 输出技术报告(论文格式,含消融实验)
毕业标准(自检清单):
- [ ] 能解释 Chinchilla Scaling Law 并做训练算力预算
- [ ] 能画出 TP/PP/ZeRO 的切分与通信示意图
- [ ] 能说清 MoE 的显存-算力解耦特性及负载均衡方案
- [ ] 能推导 DPO 损失并解释其与 PPO 的关系
- [ ] 能说明 GRPO 为什么适合可验证任务
- [ ] 能独立精读一篇模型技术报告并复现关键数字
- [ ] 交付的迷你 R1 项目达到可复现、可复盘的论文级实验标准
时间规划参考
| 周次 | 内容 |
|---|---|
| 第 1~3 周 | 模块 13:预训练全流程(重点) |
| 第 4~6 周 | 模块 14:MoE 与先进架构(重点) |
| 第 7~9 周 | 模块 15:对齐 RLHF/DPO/GRPO(重点) |
| 第 10~11 周 | 模块 16:多模态 |
| 第 12 周 | 模块 17:评测方法论 |
| 第 13~14 周 | 模块 18:综合项目(迷你 R1) |
配套资源
| 类型 | 资源 |
|---|---|
| 论文 | Chinchilla、LLaMA 3 报告、DeepSeek-V3/R1 报告、Qwen3 报告、DPO、GRPO、MoE 经典(Switch Transformer)、Mamba |
| 代码 | Megatron-LM、nanotron、TRL(DPO/GRPO)、OpenRLHF、veRL |
| 数据 | FineWeb、The Stack、UltraFeedback、OpenR1-Math |
| 课程 | Hugging Face Smol Course、Stanford CS336(从零构建 LLM) |