主题
零基础到大模型精通 —— 第二阶段:应用实战大纲
前置要求:完成第一阶段(基础筑基),能独立完成 LoRA 微调与 vLLM 部署。 阶段目标:4~8 周内掌握大模型应用开发的全套技能栈(提示工程 → RAG → Agent → 生产部署),能独立交付一个可上线的企业级 AI 应用。
模块 7:提示工程(Prompt Engineering)(1~2 周)
7.1 基础技法
- 指令的构成要素:角色、任务、上下文、输出格式、约束条件
- Zero-shot / Few-shot(示例选择策略)
- Chain-of-Thought(CoT)与 Self-Consistency
- ReAct(推理 + 行动)模式
- 结构化输出:JSON Schema、XML 标签、约束解码(guided decoding)
7.2 进阶与工程化
- 系统提示词(System Prompt)设计模式与版本管理
- 提示词注入与防护(Prompt Injection)
- 思维链模型(Reasoning Model)的提示差异:o1/R1/K2-thinking 类模型怎么写提示
- 提示词评估:构建评测集、A/B 对比、自动化回归
- 上下文工程(Context Engineering):什么该放进上下文、什么不该
实战:
- 为一个"简历解析"任务迭代提示词:从朴素指令 → few-shot → CoT → 结构化输出,量化每步的准确率提升
- 构建一个 100 条样本的提示词回归评测集
模块 8:RAG 检索增强生成(2~3 周)⭐ 重点模块
8.1 RAG 全链路拆解
- 文档加载与解析:PDF/Word/HTML/Markdown,版面分析(OCR、表格提取)
- 切分(Chunking):固定长度、语义切分、父子块、切分粒度对效果的影响
- Embedding 模型:BGE / GTE / Jina,中英选型,向量维度与精度
- 向量数据库:FAISS / Milvus / Qdrant / Chroma,HNSW 索引原理直觉
- 检索策略:稠密检索、BM25 稀疏检索、混合检索
- 重排序(Rerank):Cross-Encoder、BGE-Reranker
- 生成阶段:上下文拼接策略、引用溯源
8.2 高级 RAG
- Query 改写与扩展(HyDE、多查询、子问题分解)
- GraphRAG:知识图谱 + 检索(概念扫盲与适用场景)
- Agentic RAG:让模型自主决定"要不要检索、检索什么"
- 多模态 RAG:图文混合文档的处理(ColPali 思路扫盲)
- RAG 评估框架:RAGAS(忠实度、答案相关性、上下文召回)
8.3 工程框架
- LangChain / LlamaIndex 核心抽象(Chain、Retriever、Index)
- 不依赖框架手写一个最小 RAG(200 行),理解每一环
实战:
- 手写最小 RAG:本地文档库 + BGE embedding + FAISS + vLLM 生成
- 企业知识库问答系统:PDF 解析 → 混合检索 → Rerank → 引用溯源,并用 RAGAS 做三轮调优(切分策略 / 检索策略 / 提示词各一轮)
- 对比实验:同一份文档库,调整 chunk size(256/512/1024)对答案质量的影响
模块 9:AI Agent 开发(2~3 周)⭐ 重点模块
9.1 Agent 基础
- Agent 循环:感知 → 规划 → 行动 → 观察
- Function Calling / Tool Use 原理:JSON Schema 定义、模型如何输出工具调用
- vLLM 中启用工具调用:
--tool-call-parser、Qwen/Kimi-K2 的工具协议 - 常见工具:搜索、代码执行、数据库查询、文件操作、HTTP API
- MCP(Model Context Protocol):协议结构与客户端/服务端开发
9.2 规划与多 Agent
- 任务分解:Plan-and-Execute、ReAct、Reflexion(自我反思)
- 记忆系统:短期(上下文)/ 长期(向量库)/ 工作记忆
- 多 Agent 协作:角色分工、消息传递、编排框架(LangGraph / AutoGen / CrewAI)
- 人机协同(Human-in-the-loop):审批节点、中断与恢复
9.3 可靠性工程
- 工具调用失败重试与降级
- Agent 评估:任务成功率、步骤轨迹分析
- 成本控制:token 消耗监控、模型分级路由(简单任务用小模型)
实战:
- 用 Function Calling 手写一个"数据分析 Agent":接收自然语言 → 写并执行 pandas 代码 → 生成图表结论
- 基于 MCP 开发一个自定义工具服务并接入 Agent
- 多 Agent 实战:调研报告生成系统(规划 Agent + 检索 Agent + 写作 Agent + 评审 Agent)
模块 10:领域微调实战深化(1~2 周)
第一阶段学过 LoRA 基础,本模块面向真实业务场景深化。
10.1 数据工程(决定微调成败的 80%)
- 数据来源:真实日志脱敏、规则构造、大模型合成(蒸馏)
- 数据质量:去重、去毒、格式校验、难例挖掘
- 数据配比:领域数据与通用数据混合,防灾难性遗忘
- 偏好数据构造:chosen/rejected 对的制作
10.2 场景化微调方案
- 知识注入型 vs 行为对齐型任务的不同策略
- 单轮 vs 多轮对话数据的训练差异
- Function Calling 能力微调(工具调用数据集构造)
- 微调 vs RAG 的选型决策树(什么场景该微调、什么场景该 RAG、何时结合)
10.3 评估体系
- 领域评测集构建(黄金集)
- 自动评估:LLM-as-a-Judge 的设计与偏差控制
- 人工评估流程与标注规范
实战:选取一个真实垂直场景(如电商售后客服),完成「数据构造 → 微调 → LLM-as-a-Judge 评估 → 与 RAG 方案对比」全流程,输出选型结论报告。
模块 11:生产级部署与服务化(1~2 周)⭐ 重点模块
11.1 vLLM 生产部署
- vLLM 服务化参数详解:
--gpu-memory-utilization、--max-model-len、--max-num-seqs、--swap-space - 量化部署:AWQ / GPTQ / FP8 的加载与精度验证
- 多卡部署:张量并行(
--tensor-parallel-size)、多机扫盲 - 连续批处理(Continuous Batching)与 PagedAttention 概念
- OpenAI 兼容 API:chat/completions、streaming、结构化输出参数
11.2 服务治理
- 压测与容量规划:QPS、TTFT(首 token 延迟)、TPOT、吞吐的关系
- 负载均衡与多副本:Nginx / 网关层路由
- 监控指标:GPU 利用率、显存、KV Cache 占用率、请求排队长度
- 日志与可观测性:请求级追踪
- 成本核算:单 token 成本、GPU 利用率优化
11.3 推理引擎横向对比(选型能力)
- vLLM vs SGLang vs TensorRT-LLM vs TGI:特性、性能、生态对比
- 国产化硬件适配扫盲(昇腾等)
- 云上托管方案 vs 自建:决策因素
实战:
- 对 Qwen3-8B 做完整压测:不同并发下的 TTFT/TPOT/吞吐曲线,找到最优
max-num-seqs - 搭建带负载均衡的双副本 vLLM 集群,配合监控看板
- 输出一份《模型部署选型报告》:给定业务约束(并发、延迟、预算),给出模型 + 量化 + 硬件 + 引擎的完整方案
模块 12:应用阶段综合项目(2 周)
项目:企业级智能客服系统(可替换为任意领域)
要求整合本阶段全部技能:
- 领域知识库 RAG(PDF 解析 + 混合检索 + Rerank)
- Function Calling 打通业务系统(查订单、创建工单)
- 提示工程 + 领域微调的双轨优化与效果对比
- vLLM 生产部署:量化、压测、监控、成本核算
- 完整技术文档:架构图、评估报告、运维手册
毕业标准(自检清单):
- [ ] 能画出完整 RAG 链路图并说出每一环的常见优化手段
- [ ] 能独立设计 Function Calling 协议并处理工具调用失败
- [ ] 能给出"微调 vs RAG"的场景化选型建议并说明理由
- [ ] 能独立完成 vLLM 生产部署与压测调优
- [ ] 能解释 TTFT / TPOT / 吞吐之间的权衡关系
- [ ] 交付的系统通过 50 并发压测且 P99 延迟达标
时间规划参考
| 周次 | 内容 |
|---|---|
| 第 1~2 周 | 模块 7:提示工程 |
| 第 3~5 周 | 模块 8:RAG(重点) |
| 第 6~8 周 | 模块 9:Agent(重点) |
| 第 9~10 周 | 模块 10:领域微调深化 |
| 第 11~12 周 | 模块 11:生产部署(重点) |
| 第 13~14 周 | 模块 12:综合项目 |
配套资源
| 类型 | 资源 |
|---|---|
| 文档 | LangChain / LlamaIndex / LangGraph 官方文档、vLLM 官方文档、MCP 官方规范 |
| 书籍 | 《垂直领域大模型全栈技术教程》、《Building LLMs for Production》类实战资料 |
| 工具 | RAGAS、vLLM benchmark 工具、LangSmith(追踪)、Promptfoo(提示词评测) |
| 数据集 | Databricks Dolly、ShareGPT、行业开源指令数据集 |