← 返回课程列表
大模型推理与部署实战入门

大模型推理与部署实战入门

课程简介

本课程系统讲解大语言模型(LLM)推理优化核心技术,从模型量化、KV Cache 管理到推理加速框架。通过理论解析与实战演练,掌握在消费级硬件上高效部署百亿参数模型的方法。

学习目标

  • 理解模型量化原理与实践(GPTQ、AWQ、混合精度)
  • 掌握 KV Cache 内存管理策略(PagedAttention、vLLM)
  • 学会使用主流推理框架部署大模型(vLLM、TensorRT-LLM、llama.cpp)
  • 了解推理加速技术(Flash Attention、Speculative Decoding)

章节概览

  1. 第一章:大模型推理基础——从 Transformer 推理瓶颈说起
  2. 第二章:模型量化实战——GPTQ/AWQ 压缩与精度评估
  3. 第三章:KV Cache 与内存优化——PagedAttention 与 vLLM 部署
  4. 第四章:推理加速——Flash Attention、Speculative Decoding 与连续批处理
  5. 第五章:本地部署实战——在消费级 GPU 上运行大模型
大模型推理与部署实战入门 - 用可视化演示,真正搞懂 AI 与编程 | 必学必会