Skip to content

关于使用 vLLM 部署各类大模型(如 Qwen、DeepSeek、Kimi 等)的系统性学习资料及常用模型选择,为您梳理如下:

一、 从基础到精通的系统性书籍推荐

目前大模型技术迭代极快,传统书籍往往在出版时已有技术滞后。建议将书籍作为底层原理的“字典”,结合官方文档和前沿社区进行学习:

  1. 核心实战与部署指南类 《垂直领域大模型全栈技术教程》(清华大学出版社,2026年6月):该书系统涵盖了从提示工程、微调、RAG 到 AI Agent 开发的全流程。书中专门提供了 vLLM 手把手教学,包括本地部署、集群部署、云环境部署及国产化部署的步骤流程,非常契合您的需求。 《DeepSeek大模型实战指南:架构、部署与应用》(化学工业出版社,2025年9月):深入剖析了 DeepSeek 的底层架构(如 MoE、稀疏激活等),并详细介绍了从本地部署到云端应用的全流程实战案例,适合希望吃透特定模型架构的开发者。

  2. 理论基础与进阶架构类 《Large Language Model Foundations》:采用“五支柱”框架,系统讲解了预训练、生成模型、推理优化(量化、剪枝、蒸馏等部署技术),配有数学推导和代码实现,适合深入理解模型本质。 《Large Language Model Notebooks》(Pere Martra):实践派代表作,包含完整的 MLOps 流程,并涵盖了 2026 年最新工具链(如 vLLM、TensorRT-LLM)的实践与故障诊断。 《Rearchitecting LLMs》(Pere Martra):进阶必读,讲解“可插拔式架构”设计、动态路由和混合精度,帮助理解如何将通用模型改造为行业专属模型。

  3. 官方与开源实战资料 Hugging Face 官方出品:《Natural Language Processing with Transformers》实战性极强,适合跟着代码一步步上手。 官方 Quickstart 与文档:如 Qwen 官方提供的 Quickstart 指南,直接给出了使用 transformers 和 vLLM 部署的最简代码示例,是极佳的入门资料。

二、 vLLM 部署中常用的模型盘点

在实际工程落地中,选择模型不仅要看参数量,还要看具体的业务场景(如高并发、长文本、代码生成等)。以下是目前主流且常用的模型:

  1. Qwen(千问)系列 常用版本:Qwen3-0.6B、Qwen3-4B、Qwen3-8B、Qwen3-72B 以及 MoE 架构的 Qwen3-235B-A22B。 特点:支持超长上下文(如 262K),指令遵循和多语言能力强。小模型(如 4B)性能可媲美上一代大模型,非常适合本地部署和边缘设备。 vLLM 适配:原生支持 GQA 机制,vLLM >= 0.8.5 版本对其兼容性极佳,支持 AWQ/FP8 量化以降低显存占用。

  2. DeepSeek 系列 常用版本:DeepSeek-R1、DeepSeek-V3(6710亿参数 MoE),以及轻量级的蒸馏版本 DeepSeek-R1-Distill-Qwen-7B / 1.5B。 特点:在推理、复杂数学和代码生成上表现优异。MoE 架构使其在保持庞大参数量的同时,推理成本可控。 vLLM 适配:vLLM 对 DeepSeek 的专家并行(Expert Parallelism)和 EPLB 负载均衡有专门优化,能自动分配专家模块,避免计算倾斜,极大提升吞吐量。

  3. Kimi 系列 (Moonshot AI) 常用版本:Kimi-K2、Kimi-K2.7-Code(企业级代码模型)。 特点:在代码理解、生成及 SWE-bench 等评测中表现卓越,支持 256K 超长上下文和思维链(thinking-token)。 vLLM 适配:支持通过 --tool-call-parser kimi_k2 和 --reasoning-parser kimi_k2 参数启用工具调用和思维链解析,非常适合部署为 Coding Agent。

  4. MiniMax 等其他主流模型 常用情况:MiniMax 也是当前企业级应用中的热门选择之一,与 Qwen、DeepSeek 等一同被各大云厂商(如阿里云 PAI-EAS)纳入一键部署模板,具备成熟的生态支持。

💡 学习与实践建议 对于初学者,建议不要一开始就追求部署“满血版”的超大模型(如 671B 参数的 DeepSeek-V3 需要 8 卡高端 GPU 且资源紧张)。可以先从 Qwen3-4B/8B 或 DeepSeek-R1-Distill-7B 等蒸馏/轻量模型入手,使用 vLLM 跑通本地 API 服务,掌握显存管理(如 --gpu-memory-utilization)和量化(AWQ/FP8)技巧后,再逐步向多卡分布式部署进阶。

需要我帮你整理一份 vLLM 部署的实战速览清单吗?包括安装、配置、量化、多卡部署等关键步骤的速查版。