Skip to content

零基础到大模型精通 —— 第三阶段:进阶原理大纲

前置要求:完成第二阶段(应用实战),具备独立交付 AI 应用的能力。 阶段目标:6~10 周内深入大模型"为什么"的层面——预训练工程、先进架构(MoE/长上下文)、对齐技术(RLHF/DPO)、多模态,达到"能读论文、能复现、能做架构决策"的水平,为底层性能优化阶段储备原理弹药。


模块 13:预训练全流程工程(2~3 周)⭐ 重点模块

13.1 数据工程

  • 预训练语料的构成:网页(Common Crawl)、书籍、代码、论文、多语言
  • 数据清洗管线:去重(MinHash/SimHash)、质量过滤(分类器打分)、去 PII、去污染(与评测集重叠检测)
  • 数据配比(Data Mixture):领域配比实验、课程式配比、退火阶段(annealing)的高质量数据
  • Tokenizer 训练:BPE 压缩率、词表大小对多语言/代码的影响
  • 数据规模估算:Chinchilla 最优数据量(tokens ≈ 20 × 参数量)及其后续修正

13.2 训练工程

  • 训练目标变体:NTP、FIM(Fill-in-the-Middle)、UL2 扫盲
  • 超参数体系:学习率(warmup、cosine/linear decay、WSD schedule)、batch size 爬坡、序列长度课程(4K → 32K → 128K)
  • µP(Maximal Update Parametrization):超参数跨规模迁移的直觉
  • 稳定性工程:loss spike 的成因与应对(梯度裁剪、checkpoint 回滚、数据跳批)
  • 训练可观测性:loss 曲线、梯度范数、学习率、吞吐(tokens/GPU/s)、MFU(算力利用率)

13.3 分布式训练原理(精通阶段的预备)

  • 数据并行(DP)与梯度同步
  • 张量并行(TP):切什么、通信在哪(all-reduce)
  • 流水线并行(PP):气泡问题、1F1B 调度
  • ZeRO 三部曲:优化器状态 / 梯度 / 参数分片
  • 混合精度训练:BF16 前向 + FP32 主权重、loss scaling(FP16 时代)
  • 3D 并行的组合策略与通信拓扑(NVLink / IB)

13.4 Scaling Law 与训练决策

  • Kaplan vs Chinchilla Scaling Law:公式与含义
  • 如何用 Scaling Law 做训练前预算(参数量、数据量、算力、时长的换算)
  • Loss 预测与训练中途的"要不要继续训"决策

实战

  1. 用 Megatron-LM 或 nanotron 在单机多卡上跑通一个 100M~500M 模型的预训练(TinyStories/Fineweb 子集)
  2. 复现一个小规模 Scaling Law 实验:3 个不同尺寸模型的 loss-算力曲线拟合
  3. 计算并优化一次训练的 MFU:测吞吐、算理论峰值、找瓶颈

模块 14:先进架构专题(2~3 周)⭐ 重点模块

14.1 MoE(混合专家)

  • 稀疏激活原理:Top-K 路由、专家容量(capacity factor)
  • 负载均衡:辅助损失(auxiliary loss)vs 无辅助损失策略(DeepSeek-V3 的 bias 方案)
  • 共享专家 + 细粒度专家(Fine-grained Experts)
  • 训练挑战:路由崩塌、专家并行(EP)通信开销
  • 推理挑战:显存装全参数、计算只激活部分 → 显存-算力解耦
  • 案例精读:Mixtral 8x7B、DeepSeek-V3/R1(671B/37B 激活)、Qwen3-235B-A22B

14.2 注意力架构演进

  • MHA → MQA → GQA → MLA(Multi-head Latent Attention,DeepSeek 的低秩 KV 压缩)
  • 注意力复杂度问题与稀疏注意力:Sliding Window、NSA/DSA 扫盲
  • 线性注意力与状态空间模型:Mamba/RWKV 思路与适用边界

14.3 长上下文技术

  • RoPE 外推问题:为什么直接外推会崩
  • 位置插值(PI)、NTK-aware、YaRN 的原理差异
  • 上下文扩展训练:短训长测 vs 长文续训
  • 长上下文的系统代价:KV Cache 爆炸、注意力计算量、RULER/NIAH 评测

14.4 架构论文精读法

  • 精读清单:LLaMA 2/3、Qwen2.5/3 技术报告、DeepSeek-V2/V3、Mixtral、Gemma
  • 方法论:如何读技术报告(架构表 → 训练配方 → 消融实验 → 数据描述)

实战

  1. 手算并验证:同一 hidden size 下,MHA / GQA-8 / MLA 的 KV Cache 显存差异
  2. 用 YaRN 将一个 8K 上下文模型扩展到 32K,并用大海捞针(NIAH)测试验证
  3. 阅读 DeepSeek-V3 技术报告,输出一份架构要点拆解笔记(MoE + MLA + 训练工程)

模块 15:对齐技术(Alignment)(2~3 周)⭐ 重点模块

15.1 RLHF 经典管线

  • 三步曲:SFT → 奖励模型(RM)→ PPO
  • Bradley-Terry 偏好建模与 RM 训练
  • PPO 细节:KL 惩罚、价值网络、优势估计、reward hacking 问题
  • RLHF 的工程痛点:四个模型同时在场的显存与调度(RLHF 框架为什么复杂)

15.2 免 RL 的对齐方法

  • DPO:从 BT 模型直接推导的策略优化、与 PPO 的效果对比
  • 变体家族:IPO、KTO、ORPO、SimPO——各自解决什么问题
  • GRPO:DeepSeek-R1 采用的组相对策略优化,为什么省掉价值网络
  • 在线 vs 离线偏好优化

15.3 推理能力对齐(Reasoning)

  • RLVR(可验证奖励强化学习):数学/代码任务上的自动判分
  • 长思维链(Long CoT)的涌现:aha moment、长度膨胀与过度思考
  • R1 式训练配方:冷启动 SFT → RL → 拒绝采样 → 全场景 SFT
  • 蒸馏小模型的 reasoning 能力迁移

15.4 安全对齐

  • 有害请求拒答、红队测试(Red Teaming)
  • 宪法 AI(Constitutional AI)思路
  • 越狱攻防与评估基准

实战

  1. 用 TRL 对 1.5B 模型跑通完整 DPO:构造偏好对 → 训练 → 前后对比
  2. 复现微型 GRPO:在 GSM8K 上用规则判分器训练小模型,观察推理链变化
  3. 对同一 SFT 模型分别做 DPO / KTO,设计实验对比胜率与副作用(如长度漂移)

模块 16:多模态大模型(1~2 周)

16.1 视觉语言模型(VLM)

  • 架构范式:视觉编码器(ViT/SigLIP)+ 投影层 + LLM
  • LLaVA 管线:两阶段训练(对齐投影层 → 指令微调)
  • 高分辨率处理:动态切图、视觉 token 压缩
  • Qwen2-VL/Qwen2.5-VL 的架构要点(NaViT、MRoPE)

16.2 其他模态

  • 音频模型:Whisper 编码器 + LLM、语音对话(端到端 vs 级联)
  • 视频理解:帧采样策略与时序建模
  • 统一多模态:理解与生成一体化(any-to-any 扫盲)

16.3 图像生成侧(了解即可)

  • 扩散模型原理 10 分钟版:加噪与去噪
  • 文生图管线:CLIP/DiT/SD3 的概念位置

实战

  1. 用 vLLM 部署 Qwen2.5-VL,完成文档图片问答与表格识别
  2. 构造 500 条领域 VQA 数据,微调 VLM 并对比基线

模块 17:评测与科学实验方法(1 周)

17.1 评测体系

  • 通用基准:MMLU / C-Eval / GSM8K / HumanEval / MMLU-Pro 的适用性与污染问题
  • 推理基准:AIME、GPQA、LiveCodeBench
  • 开放生成评估:MT-Bench、Arena(ELO)、LLM-as-a-Judge 的偏差(位置偏好、长度偏好、自我偏好)
  • 评测基础设施:lm-evaluation-harness、OpenCompass

17.2 实验方法论

  • 消融实验(Ablation)设计:控制变量
  • 统计显著性:多次运行、方差、Bootstrap
  • 如何避免"评测过拟合":留出私有评测集
  • 技术报告阅读与批判性复现

实战:为一个垂直模型设计完整评测方案(公开基准 + 自建黄金集 + LLM-Judge + 人工抽检),并对两轮模型迭代做显著性分析。


模块 18:进阶阶段综合项目(2 周)

项目:从 0 到 1 复刻一条"迷你 R1"管线

  1. 选一个 1.5B~4B 基座模型
  2. 收集/合成数学推理数据,冷启动 SFT
  3. 用 GRPO 做 RL 训练(规则判分),追踪 pass@1 与思维链长度曲线
  4. 蒸馏对比:直接用 R1 蒸馏数据 SFT vs 自己的 RL 结果
  5. 完整评测:GSM8K / MATH / 自建集 + 显著性分析
  6. 输出技术报告(论文格式,含消融实验)

毕业标准(自检清单)

  • [ ] 能解释 Chinchilla Scaling Law 并做训练算力预算
  • [ ] 能画出 TP/PP/ZeRO 的切分与通信示意图
  • [ ] 能说清 MoE 的显存-算力解耦特性及负载均衡方案
  • [ ] 能推导 DPO 损失并解释其与 PPO 的关系
  • [ ] 能说明 GRPO 为什么适合可验证任务
  • [ ] 能独立精读一篇模型技术报告并复现关键数字
  • [ ] 交付的迷你 R1 项目达到可复现、可复盘的论文级实验标准

时间规划参考

周次内容
第 1~3 周模块 13:预训练全流程(重点)
第 4~6 周模块 14:MoE 与先进架构(重点)
第 7~9 周模块 15:对齐 RLHF/DPO/GRPO(重点)
第 10~11 周模块 16:多模态
第 12 周模块 17:评测方法论
第 13~14 周模块 18:综合项目(迷你 R1)

配套资源

类型资源
论文Chinchilla、LLaMA 3 报告、DeepSeek-V3/R1 报告、Qwen3 报告、DPO、GRPO、MoE 经典(Switch Transformer)、Mamba
代码Megatron-LM、nanotron、TRL(DPO/GRPO)、OpenRLHF、veRL
数据FineWeb、The Stack、UltraFeedback、OpenR1-Math
课程Hugging Face Smol Course、Stanford CS336(从零构建 LLM)