
大模型推理加速实战:从推测解码到量化部署
课程简介
当大模型从"能跑"走向"跑得便宜、跑得快",推理优化就成了工程竞争力的核心。本课程以今天最实用的三类加速技术为主线——推测解码、量化、高效推理框架(vLLM / llama.cpp / SGLang)——带你从原理到部署打通全链路。无论你是想在自己笔记本上跑通 27B 模型,还是为线上服务把成本压一半,都能在这里找到可落地的方案。
学习目标
- 理解自回归生成的延迟构成,能定位"卡"在预填充还是解码。
- 讲清推测解码、MTP、Medusa、量化各自的加速原理与适用场景。
- 能在本地用 llama.cpp / vLLM 开启推测解码与量化,并做前后对比评测。
- 能根据硬件(显存、带宽)选择模型与加速组合,给出性价比决策。
章节概览
- 第一章:延迟从哪里来——prefill 与 decode 的解剖
- 第二章:推测解码家族(草稿模型 / 自投机 / MTP / 候选树)
- 第三章:量化基础(INT8 / INT4 / GPTQ / AWQ)与精度权衡
- 第四章:推理框架实战(vLLM 的 PagedAttention、llama.cpp 的 MTP、SGLang 的 RadixAttention)
- 第五章:端到端评测与成本测算——把"快"变成"省"