← 返回内容列表

张量网络压缩大模型:MixT 与那个「相变」式的临界点

分享本文
张量网络压缩大模型:MixT 与那个「相变」式的临界点

中科院理论物理研究所苏刚团队联合首都师范大学冉仕举课题组提出 Tensor Mixture(MixT)张量混合压缩框架,把 Transformer 中的稠密线性映射重构为可直接执行的张量算子混合体。在 LLaMA2-7B 上,最佳压缩位置实现参数减少 47.5%、推理显存降低 60.4%,而 MMLU 综合能力几乎不变,并观察到一个类似相变的压缩临界点。

模型压缩这件事,主流做法是把大模型里那些「不太重要」的权重剪掉、量化掉,或者让小模型去模仿大模型的输出。这些方法共享一个前提:压缩是损失,能少损失一点是一点。2026 年 8 月 20 日《中国科学报》报道的工作换了个出发点。论文在 arXiv(编号 10.48550/arXiv.2605.25344),已获国家发明专利,由中科院理论物理研究所苏刚团队联合首都师范大学冉仕举课题组完成。

把张量网络搬进 Transformer

张量网络(tensor network)是量子物理里处理高维对象的工具。一个 NN 维张量的参数量随维度指数增长,直接存不下来;把它拆成若干低阶张量的收缩网络,参数量可以呈数量级下降,而主要信息被保留。矩阵乘积态、密度矩阵重正化群都建立在这个思路上。

此前有人用张量网络压缩神经网络,但多半只把张量当作一种存储格式:先按张量形式存参数,推理时再还原成稠密矩阵计算。MixT(Tensor Mixture)的不同之处在于,它把 Transformer 模块里的标准稠密线性映射直接重构为可执行的张量算子混合体,推理时就以张量运算的形式跑完,全程保留张量运算架构。省下的不只是存储,还有乘加次数。

同一个线性层,两种表示

图1:稠密线性映射与 MixT 张量算子混合体的结构对比(示意)

形式上看,一个稠密权重矩阵被替换成若干小矩阵的组合,计算时按收缩顺序依次作用:

y=(k=1KA(k)B(k))xy = \left(\sum_{k=1}^{K} A^{(k)} \otimes B^{(k)}\right) x

参数量从 O(d2)O(d^2) 降到 O(Kd2/r)O(Kd^2/r) 量级,具体比例由秩 rr 与混合项数 KK 决定。

LLaMA2-7B 上的四个数字

在 LLaMA2-7B 上,最佳压缩位置的结果为:总参数减少 47.5%,推理计算量降低 37.1%,训练计算量降低 52.1%,推理显存降低 60.4%。同一设置下,大规模多任务语言理解基准(MMLU)上的综合能力几乎保持不变。

训练计算量降幅比推理更大,这一点值得留意。它意味着 MixT 不只是推理阶段的加速器,微调与继续预训练的成本也会跟着下降。

那个临界点

更有意思的发现是压缩率的非线性。团队观察到,在压缩幅度未达某个阈值之前,模型体量不断缩小而性能几乎不衰减;一旦越过某个临界位置,能力骤然下降。曲线形状与物理里的相变很像:连续变化的原因在某个点之后引发结果的突变。

压缩率与性能:一个类相变的临界点

图2:压缩幅度与模型能力的示意关系,越过临界位置后性能快速塌陷

如果这个现象普遍成立,含义很直接:存在一个能维持智能的最低结构复杂度,参数量堆得再多,超出部分是冗余,不是能力。这解释了为什么剪枝与量化常常能在损失极小的情况下砍掉一大半参数。

落到设备上,结果是同样的 GPU 能跑更大的模型,或者更便宜的 GPU 也能跑原本只有高端服务器才跑得动的模型。

哪些话现在还不能说

结果只在 LLaMA2-7B 上验证过。其他架构、尤其是混合专家(MoE)结构是否出现同样的临界点,更大规模模型(70B 及以上)的临界位置落在哪里,都还没有公开数据。论文发表在 arXiv 上,尚未经过同行评议。另外,「几乎不变」的描述缺少误差范围与逐项分解,MMLU 总分不变也可能掩盖个别子项的下降。这些都要等论文正式发表与第三方复现。

关联推荐

评论 (0)

正文划词可点「问萝卜特」——自动发评论并由 AI 回复

加载评论中…

张量网络压缩大模型:MixT 与那个「相变」式的临界点 | 必学必会