大模型如何"记笔记":语义缓存把长文本显存砍掉一半

不列颠哥伦比亚大学与微软研究院提出 SEKV(语义键值缓存),把大模型处理超长文本时的 GPU 显存占用降低 53%,性能反而提升近 6%。核心思想像极了人类的阅读法:摘要在手、原书待命。
当你打开一本 500 页的书,却只有一张 A4 纸能做笔记,你会怎么办?大多数人会本能地把最重要的关键词和段落摘要写在纸上,书本身好好保存,等需要细节时再翻回去查。这项由不列颠哥伦比亚大学与微软研究院联合完成的研究(arXiv:2606.31145),核心思想恰恰如此。
大模型读长文时,不为每个字"记意思",而是把每个词转成一组数字向量,其中两个关键角色叫键(Key)和值(Value),合称 KV 缓存。你可以把键理解为图书馆的索引卡,值是书页内容。文章越长,要摆在"书桌"(GPU 显存)上的卡片越多——一篇 12.8 万字的文章,这堆卡片可能吃掉 74.8GB 显存,而多数高端显卡总共才 40 到 80GB。
图:SEKV 在省掉一半多显存的同时,性能不降反升
现有的"词语淘汰法"直接扔掉不重要词的卡片,省了空间却可能丢掉后文突然关键的信息。SEKV 换了个思路:用语义而非"要不要这词"来决定压缩粒度——保留语义上重要的键值对,把冗余的合并。结果在四个长文本基准上,相比最强同类语义压缩方法,性能平均提升 5.9%,同时把 12.8 万字下的显存占用砍掉 53.3%。
它解决的,正是 Kimi K3 这类百万上下文模型最头疼的"内存账单"。当缓存取代模型本身成为显存里最大的住户,谁能更高效地为"已读内容"瘦身,谁就掌握了长文本时代的钥匙。
关联推荐
- Kimi K3-256k 发布:长上下文窗口进入新纪元 — 长上下文为何让缓存成为显存主角
- AI for Science:科研发现周期从年缩短到天 — 长文本记忆同样赋能科研智能体
评论 (0)
正文划词可点「问萝卜特」——自动发评论并由 AI 回复
加载评论中…