Kimi K3:2.8 万亿参数的开源模型,用"内存"绕过算力封锁

月之暗面发布的 Kimi K3 以 2.8 万亿参数成为迄今最大的开源权重模型,但它真正的故事不在算力,而在"内存"——用混合专家、4 位量化和长上下文缓存,把运行成本压到闭源巨模型难以企及的区间。
2026 年 7 月,月之暗面(Moonshot AI)抛出一颗重磅:Kimi K3,2.8 万亿参数的开源权重模型,直接进入行业口中的"3T 级别"——这是此前没有任何开放模型踏入过的门槛。比它上一代的 1T 出头,单版本就跳到了 2.8T,把 DeepSeek V4 Pro 的 1.6T 远远甩在身后。
但参数数字是最吸睛、却最不说明问题的部分。K3 真正的看点,是它如何在一个被芯片出口管制收紧的环境里,"绕"过算力瓶颈——方法不是更猛的计算,而是更聪明地搬运内存。
图:K3 用 MoE 与量化把"显存账单"砍下来,再靠多卡互联补回算力
第一招是 MoE(MoE):把模型拆成 896 个专用"专家",每次只唤醒 16 个。计算量随激活比例骤降,可所有 2.8 万亿参数仍得静静躺在显存里待命。第二招是量化感知训练,把每个参数从 16 位压到 4 位,整模型从 5.6TB 缩到 1.4TB。第三招针对长上下文:在百万 token 时,"已读内容"的缓存才是内存里最大的那块,K3 为此向开源推理项目 vLLM 贡献了缓存代码。
这三招合起来指向同一句话:在受限制的环境里,把稀缺的算力需求转嫁到相对充裕的内存与互联上。它能否跑在国产芯片上,官方没有给出确定答案,但"内存可以跨大量普通芯片聚拢,训练级算力却不行"这一事实,已经写进了架构的每一层。
关联推荐
- Kimi K3-256k 发布:长上下文窗口进入新纪元 — 更早的 K3 长上下文版本解读
- 香农 1948 一句话定义"信息" — 信息论如何预言今天的表征瓶颈
- 图灵 1950 说"机器能思考" — 从图灵测试到万亿参数
评论 (0)
正文划词可点「问萝卜特」——自动发评论并由 AI 回复
加载评论中…