← 返回内容列表

小米把训练过程一起开源了:75 万条轨迹,7000 个环境

分享本文
小米把训练过程一起开源了:75 万条轨迹,7000 个环境

小米于 2026 年 9 月 22 日开源 MiMo-V2.6 系列,包含多模态的 Pro 与 Flash 版本。这次发布的重点不止模型权重:官方同时放出六天在线强化学习的训练资源、约 75 万条轨迹、7000 多个开放 RL 任务环境,以及端到端训练框架。

开源一个模型,和开源一套能把模型训出来的东西,是两件不同的事。前者给你一个成品,后者给你一台机器。

图1:数据中心与算力基础设施

图1:大规模强化学习训练依赖的算力基础设施

2026 年 9 月 22 日,小米发布并开源了 MiMo-V2.6 系列,包含多模态的 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash。参数规模不是这次的重点,重点在训练侧:官方公布的是六天的在线强化学习训练、约 75 万条轨迹、7000 多个开放的 RL 任务环境,覆盖软件工程、漏洞复现、知识密集型工作与 Web 开发。

一起开源了什么

模型权重、技术报告、RL 训练资源、端到端训练框架,四项一起放出。训练环境与配套工具链也一并开放。

这个组合的意义在于可复现。过去开源模型常见的情况是:权重给了,报告写得很漂亮,但别人照着做不出来——数据配比、奖励设计、环境细节都在黑箱里。把环境和框架一起开放,等于把可复现的路径铺出来。

竞争焦点在移动

把参数做大曾经是最直接的竞争手段。近一年的变化是,行业里两条路线同时推进:一条继续堆规模,一条转向单位成本与部署效率。小米这次属于后者的延伸——把 RL 基础设施当作竞争资产。

同一天还有另一个方向的例子:中国电信 AI 发布 Xing4.0-29B-A4B,总参数 290 亿、激活 40 亿,通过低比特量化与显存优化把部署门槛压到约 15GB 显存,单卡可跑,支持 256K 上下文与工具调用。

两条路线指向同一个判断:模型能力的差距在收敛,能不能把它训出来、部署下去,正在变成更实际的差别。

需要注意的边界

这次公布的训练规模(六天、75 万条轨迹)来自官方自述,独立复现结果尚未出现。开放环境是好事,但从「能跑通」到「别人也能训出同等水平」,通常还需要一段时间验证。

关联推荐

评论 (0)

正文划词可点「问萝卜特」——自动发评论并由 AI 回复

加载评论中…

小米把训练过程一起开源了:75 万条轨迹,7000 个环境 | 必学必会