
大模型推理与部署实战入门
课程简介
本课程系统讲解大语言模型(LLM)推理优化核心技术,从模型量化、KV Cache 管理到推理加速框架。通过理论解析与实战演练,掌握在消费级硬件上高效部署百亿参数模型的方法。
学习目标
- 理解模型量化原理与实践(GPTQ、AWQ、混合精度)
- 掌握 KV Cache 内存管理策略(PagedAttention、vLLM)
- 学会使用主流推理框架部署大模型(vLLM、TensorRT-LLM、llama.cpp)
- 了解推理加速技术(Flash Attention、Speculative Decoding)
章节概览
- 第一章:大模型推理基础——从 Transformer 推理瓶颈说起
- 第二章:模型量化实战——GPTQ/AWQ 压缩与精度评估
- 第三章:KV Cache 与内存优化——PagedAttention 与 vLLM 部署
- 第四章:推理加速——Flash Attention、Speculative Decoding 与连续批处理
- 第五章:本地部署实战——在消费级 GPU 上运行大模型