
投机解码实战:用 DeepSpec 训练你的 LLM 加速草稿模型
课程简介
本课程带你深入掌握投机解码(speculative decoding)技术——从原理到实战,从训练草稿模型到部署推理服务。你将使用 DeepSeek 开源的 DeepSpec 框架,为 LLM 训练专属的草稿模型,并通过 vLLM 和 SGLang 部署加速推理服务。课程涵盖 DSpark、DFlash、Eagle3 三种主流草稿算法的对比与选择。
学习目标
- 理解投机解码的数学原理:接受/拒绝采样、接受率优化
- 使用 DeepSpec 框架训练针对特定模型的草稿模块
- 掌握 vLLM 和 SGLang 中启用投机解码的配置方法
- 能够评估不同草稿算法(DSpark / DFlash / Eagle3)在特定任务上的表现
- 理解投机解码在 AI Agent 高并发场景中的经济学影响
章节概览
- 第一章:LLM 推理瓶颈分析——自回归生成、显存带宽、KV Cache
- 第二章:投机解码原理——草稿生成、并行验证、接受/拒绝采样
- 第三章:DeepSpec 框架入门——仓库结构、配置文件、环境搭建
- 第四章:数据准备——构建目标缓存(target cache)与训练集
- 第五章:训练草稿模型——DSpark 训练脚本、超参数调优、多 GPU 训练
- 第六章:评估与对比——GSM8K、HumanEval、LiveCodeBench 基准测试
- 第七章:部署推理——vLLM / SGLang 集成、生产环境配置
- 第八章:进阶——DFlash vs DSpark vs Eagle3 算法对比与选择
- 第九章:Agent 场景优化——长链路推理的投机解码策略