← 返回课程列表
投机解码实战:用 DeepSpec 训练你的 LLM 加速草稿模型

投机解码实战:用 DeepSpec 训练你的 LLM 加速草稿模型

课程简介

本课程带你深入掌握投机解码(speculative decoding)技术——从原理到实战,从训练草稿模型到部署推理服务。你将使用 DeepSeek 开源的 DeepSpec 框架,为 LLM 训练专属的草稿模型,并通过 vLLMSGLang 部署加速推理服务。课程涵盖 DSpark、DFlashEagle3 三种主流草稿算法的对比与选择。

学习目标

  • 理解投机解码的数学原理:接受/拒绝采样、接受率优化
  • 使用 DeepSpec 框架训练针对特定模型的草稿模块
  • 掌握 vLLM 和 SGLang 中启用投机解码的配置方法
  • 能够评估不同草稿算法(DSpark / DFlash / Eagle3)在特定任务上的表现
  • 理解投机解码在 AI Agent 高并发场景中的经济学影响

章节概览

  1. 第一章:LLM 推理瓶颈分析——自回归生成、显存带宽、KV Cache
  2. 第二章:投机解码原理——草稿生成、并行验证、接受/拒绝采样
  3. 第三章:DeepSpec 框架入门——仓库结构、配置文件、环境搭建
  4. 第四章:数据准备——构建目标缓存(target cache)与训练集
  5. 第五章:训练草稿模型——DSpark 训练脚本、超参数调优、多 GPU 训练
  6. 第六章:评估与对比——GSM8K、HumanEval、LiveCodeBench 基准测试
  7. 第七章:部署推理——vLLM / SGLang 集成、生产环境配置
  8. 第八章:进阶——DFlash vs DSpark vs Eagle3 算法对比与选择
  9. 第九章:Agent 场景优化——长链路推理的投机解码策略
投机解码实战:用 DeepSpec 训练你的 LLM 加速草稿模型 | 必学必会