Skip to content

零基础到大模型精通 —— 第二阶段:应用实战大纲

前置要求:完成第一阶段(基础筑基),能独立完成 LoRA 微调与 vLLM 部署。 阶段目标:4~8 周内掌握大模型应用开发的全套技能栈(提示工程 → RAG → Agent → 生产部署),能独立交付一个可上线的企业级 AI 应用。


模块 7:提示工程(Prompt Engineering)(1~2 周)

7.1 基础技法

  • 指令的构成要素:角色、任务、上下文、输出格式、约束条件
  • Zero-shot / Few-shot(示例选择策略)
  • Chain-of-Thought(CoT)与 Self-Consistency
  • ReAct(推理 + 行动)模式
  • 结构化输出:JSON Schema、XML 标签、约束解码(guided decoding)

7.2 进阶与工程化

  • 系统提示词(System Prompt)设计模式与版本管理
  • 提示词注入与防护(Prompt Injection)
  • 思维链模型(Reasoning Model)的提示差异:o1/R1/K2-thinking 类模型怎么写提示
  • 提示词评估:构建评测集、A/B 对比、自动化回归
  • 上下文工程(Context Engineering):什么该放进上下文、什么不该

实战

  1. 为一个"简历解析"任务迭代提示词:从朴素指令 → few-shot → CoT → 结构化输出,量化每步的准确率提升
  2. 构建一个 100 条样本的提示词回归评测集

模块 8:RAG 检索增强生成(2~3 周)⭐ 重点模块

8.1 RAG 全链路拆解

  • 文档加载与解析:PDF/Word/HTML/Markdown,版面分析(OCR、表格提取)
  • 切分(Chunking):固定长度、语义切分、父子块、切分粒度对效果的影响
  • Embedding 模型:BGE / GTE / Jina,中英选型,向量维度与精度
  • 向量数据库:FAISS / Milvus / Qdrant / Chroma,HNSW 索引原理直觉
  • 检索策略:稠密检索、BM25 稀疏检索、混合检索
  • 重排序(Rerank):Cross-Encoder、BGE-Reranker
  • 生成阶段:上下文拼接策略、引用溯源

8.2 高级 RAG

  • Query 改写与扩展(HyDE、多查询、子问题分解)
  • GraphRAG:知识图谱 + 检索(概念扫盲与适用场景)
  • Agentic RAG:让模型自主决定"要不要检索、检索什么"
  • 多模态 RAG:图文混合文档的处理(ColPali 思路扫盲)
  • RAG 评估框架:RAGAS(忠实度、答案相关性、上下文召回)

8.3 工程框架

  • LangChain / LlamaIndex 核心抽象(Chain、Retriever、Index)
  • 不依赖框架手写一个最小 RAG(200 行),理解每一环

实战

  1. 手写最小 RAG:本地文档库 + BGE embedding + FAISS + vLLM 生成
  2. 企业知识库问答系统:PDF 解析 → 混合检索 → Rerank → 引用溯源,并用 RAGAS 做三轮调优(切分策略 / 检索策略 / 提示词各一轮)
  3. 对比实验:同一份文档库,调整 chunk size(256/512/1024)对答案质量的影响

模块 9:AI Agent 开发(2~3 周)⭐ 重点模块

9.1 Agent 基础

  • Agent 循环:感知 → 规划 → 行动 → 观察
  • Function Calling / Tool Use 原理:JSON Schema 定义、模型如何输出工具调用
  • vLLM 中启用工具调用:--tool-call-parser、Qwen/Kimi-K2 的工具协议
  • 常见工具:搜索、代码执行、数据库查询、文件操作、HTTP API
  • MCP(Model Context Protocol):协议结构与客户端/服务端开发

9.2 规划与多 Agent

  • 任务分解:Plan-and-Execute、ReAct、Reflexion(自我反思)
  • 记忆系统:短期(上下文)/ 长期(向量库)/ 工作记忆
  • 多 Agent 协作:角色分工、消息传递、编排框架(LangGraph / AutoGen / CrewAI)
  • 人机协同(Human-in-the-loop):审批节点、中断与恢复

9.3 可靠性工程

  • 工具调用失败重试与降级
  • Agent 评估:任务成功率、步骤轨迹分析
  • 成本控制:token 消耗监控、模型分级路由(简单任务用小模型)

实战

  1. 用 Function Calling 手写一个"数据分析 Agent":接收自然语言 → 写并执行 pandas 代码 → 生成图表结论
  2. 基于 MCP 开发一个自定义工具服务并接入 Agent
  3. 多 Agent 实战:调研报告生成系统(规划 Agent + 检索 Agent + 写作 Agent + 评审 Agent)

模块 10:领域微调实战深化(1~2 周)

第一阶段学过 LoRA 基础,本模块面向真实业务场景深化。

10.1 数据工程(决定微调成败的 80%)

  • 数据来源:真实日志脱敏、规则构造、大模型合成(蒸馏)
  • 数据质量:去重、去毒、格式校验、难例挖掘
  • 数据配比:领域数据与通用数据混合,防灾难性遗忘
  • 偏好数据构造:chosen/rejected 对的制作

10.2 场景化微调方案

  • 知识注入型 vs 行为对齐型任务的不同策略
  • 单轮 vs 多轮对话数据的训练差异
  • Function Calling 能力微调(工具调用数据集构造)
  • 微调 vs RAG 的选型决策树(什么场景该微调、什么场景该 RAG、何时结合)

10.3 评估体系

  • 领域评测集构建(黄金集)
  • 自动评估:LLM-as-a-Judge 的设计与偏差控制
  • 人工评估流程与标注规范

实战:选取一个真实垂直场景(如电商售后客服),完成「数据构造 → 微调 → LLM-as-a-Judge 评估 → 与 RAG 方案对比」全流程,输出选型结论报告。


模块 11:生产级部署与服务化(1~2 周)⭐ 重点模块

11.1 vLLM 生产部署

  • vLLM 服务化参数详解:--gpu-memory-utilization--max-model-len--max-num-seqs--swap-space
  • 量化部署:AWQ / GPTQ / FP8 的加载与精度验证
  • 多卡部署:张量并行(--tensor-parallel-size)、多机扫盲
  • 连续批处理(Continuous Batching)与 PagedAttention 概念
  • OpenAI 兼容 API:chat/completions、streaming、结构化输出参数

11.2 服务治理

  • 压测与容量规划:QPS、TTFT(首 token 延迟)、TPOT、吞吐的关系
  • 负载均衡与多副本:Nginx / 网关层路由
  • 监控指标:GPU 利用率、显存、KV Cache 占用率、请求排队长度
  • 日志与可观测性:请求级追踪
  • 成本核算:单 token 成本、GPU 利用率优化

11.3 推理引擎横向对比(选型能力)

  • vLLM vs SGLang vs TensorRT-LLM vs TGI:特性、性能、生态对比
  • 国产化硬件适配扫盲(昇腾等)
  • 云上托管方案 vs 自建:决策因素

实战

  1. 对 Qwen3-8B 做完整压测:不同并发下的 TTFT/TPOT/吞吐曲线,找到最优 max-num-seqs
  2. 搭建带负载均衡的双副本 vLLM 集群,配合监控看板
  3. 输出一份《模型部署选型报告》:给定业务约束(并发、延迟、预算),给出模型 + 量化 + 硬件 + 引擎的完整方案

模块 12:应用阶段综合项目(2 周)

项目:企业级智能客服系统(可替换为任意领域)

要求整合本阶段全部技能:

  1. 领域知识库 RAG(PDF 解析 + 混合检索 + Rerank)
  2. Function Calling 打通业务系统(查订单、创建工单)
  3. 提示工程 + 领域微调的双轨优化与效果对比
  4. vLLM 生产部署:量化、压测、监控、成本核算
  5. 完整技术文档:架构图、评估报告、运维手册

毕业标准(自检清单)

  • [ ] 能画出完整 RAG 链路图并说出每一环的常见优化手段
  • [ ] 能独立设计 Function Calling 协议并处理工具调用失败
  • [ ] 能给出"微调 vs RAG"的场景化选型建议并说明理由
  • [ ] 能独立完成 vLLM 生产部署与压测调优
  • [ ] 能解释 TTFT / TPOT / 吞吐之间的权衡关系
  • [ ] 交付的系统通过 50 并发压测且 P99 延迟达标

时间规划参考

周次内容
第 1~2 周模块 7:提示工程
第 3~5 周模块 8:RAG(重点)
第 6~8 周模块 9:Agent(重点)
第 9~10 周模块 10:领域微调深化
第 11~12 周模块 11:生产部署(重点)
第 13~14 周模块 12:综合项目

配套资源

类型资源
文档LangChain / LlamaIndex / LangGraph 官方文档、vLLM 官方文档、MCP 官方规范
书籍《垂直领域大模型全栈技术教程》、《Building LLMs for Production》类实战资料
工具RAGAS、vLLM benchmark 工具、LangSmith(追踪)、Promptfoo(提示词评测)
数据集Databricks Dolly、ShareGPT、行业开源指令数据集