← 返回内容列表

大模型如何"记笔记":语义缓存把长文本显存砍掉一半

分享本文
大模型如何"记笔记":语义缓存把长文本显存砍掉一半

不列颠哥伦比亚大学与微软研究院提出 SEKV(语义键值缓存),把大模型处理超长文本时的 GPU 显存占用降低 53%,性能反而提升近 6%。核心思想像极了人类的阅读法:摘要在手、原书待命。

当你打开一本 500 页的书,却只有一张 A4 纸能做笔记,你会怎么办?大多数人会本能地把最重要的关键词和段落摘要写在纸上,书本身好好保存,等需要细节时再翻回去查。这项由不列颠哥伦比亚大学与微软研究院联合完成的研究(arXiv:2606.31145),核心思想恰恰如此。

大模型读长文时,不为每个字"记意思",而是把每个词转成一组数字向量,其中两个关键角色叫键(Key)值(Value),合称 KV 缓存。你可以把键理解为图书馆的索引卡,值是书页内容。文章越长,要摆在"书桌"(GPU 显存)上的卡片越多——一篇 12.8 万字的文章,这堆卡片可能吃掉 74.8GB 显存,而多数高端显卡总共才 40 到 80GB。

12.8 万字上下文的显存占用

图:SEKV 在省掉一半多显存的同时,性能不降反升

现有的"词语淘汰法"直接扔掉不重要词的卡片,省了空间却可能丢掉后文突然关键的信息。SEKV 换了个思路:用语义而非"要不要这词"来决定压缩粒度——保留语义上重要的键值对,把冗余的合并。结果在四个长文本基准上,相比最强同类语义压缩方法,性能平均提升 5.9%,同时把 12.8 万字下的显存占用砍掉 53.3%。

它解决的,正是 Kimi K3 这类百万上下文模型最头疼的"内存账单"。当缓存取代模型本身成为显存里最大的住户,谁能更高效地为"已读内容"瘦身,谁就掌握了长文本时代的钥匙。

关联推荐

---

评论 (0)

正文划词可点「问萝卜特」——自动发评论并由 AI 回复

加载评论中…