就在刚才,小米 MiMo 团队对外披露了其最新动态。
小米 MiMo 的负责人罗福莉在 X 平台发文称,过去近半年时间里,团队一直在聚焦一个问题进行探索:强化学习(RL)究竟还能拓展到何种地步。
她透露,目前 MiMo-V2.6 正处于 RL 训练阶段,团队正在从三个维度扩大规模,分别是计算资源、训练环境与任务体系,以及奖励评估机制。未来几周内,小米 MiMo 团队会逐步公开更多技术细节。
直播链接 https://mimo.xiaomi.com/rl/#overview
与此同时,罗福莉还分享了 MiMo-V2.6 的实时训练页面,让外界首次得以目睹这一代模型在强化学习阶段的部分训练状况。
从罗福莉公开的训练页面来看,MiMo-V2.6 目前正在进行一次大规模的 Agent 强化学习实验。页面展示了模型训练的进度、Token 消耗量、训练成本、样本数量以及多项内部指标的变化。
当前训练页面包含两个版本,分别是 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash。
其中,MiMo-V2.6-Pro 目前处于 step 12 阶段,累计训练样本约为 301K,训练成本约为 806,349 美元,累计消耗 Token 达到 25.1B。
MiMo-V2.6-Flash 目前处于 step 17 阶段,累计训练样本约为 426K,训练成本约为 354,499 美元,累计消耗 Token 达到 40.5B。
两个版本当前的累计训练成本已超过 116 万美元,平均每小时的计算成本约为 3.09 万美元(折合人民币约 20.72 万元)。 不过,从训练面板的数据来看,小米此次公开的重点并非成本,而是展示 RL 训练过程中,模型如何通过大规模任务交互来持续提升能力。
罗福莉在 X 中提到,MiMo-V2.6 本轮强化学习训练的重点在于扩大三个方向。
第一个方向是计算规模。
她表示,团队将单个训练 step 的规模提升至约 2B tokens,同时采用了 1568 个 prompts × 16 rollouts 的训练方式,并使用了 fully async,即完全异步训练。
按照这一配置计算,单个训练 step 理论上会产生约 2.5 万次模型尝试,相当于让 AI 同时探索大量不同的解决路径。
在这种训练方式下,模型面对一个任务时,不会只生成一次答案,而是会同时尝试多种解决方案,再根据奖励反馈来判断哪些路径更为有效。
对于 Agent 模型来说,大规模探索能力至关重要。过去的大模型更多依赖预训练获取知识,再通过监督微调来调整输出方式。
但当 AI 开始承担编程、办公、资料分析等复杂任务后,模型需要的不仅仅是回答问题,还需要规划步骤、调用工具、验证结果。
强化学习的价值,就在于让模型通过大量尝试和反馈,逐步形成更有效的任务执行策略。
第二个方向是训练环境。罗福莉表示,团队扩大了 environments 和 harnesses,引入了 multi-task agentic RL,将多个任务环境混合到一次训练流程中。
从 MiMo-V2.6 实时监控面板显示的数据来看,当前训练任务覆盖了视觉、代码、通用任务以及聊天任务。
页面中可以看到 visual/dataset-jz3d、visual/dataset-gtaV、visual/dataset-vs3e 等视觉数据集,也包含 code/dataset-4qn 等代码任务,以及 general、chat 类数据集。
这意味着 MiMo-V2.6 并非只优化某一种能力,而是在尝试让模型同时适应不同类型的 Agent 场景。
第三个方向是增加评判系统的计算投入。
罗福莉提到,团队引入了 agentic in-group credit assignment,并结合 test-case 和 rubric-based rewards。
复杂的 Agent 任务通常包含多个执行步骤。
模型可能需要先搜索信息,再制定方案,然后调用工具完成任务。
罗福莉提到,团队采用了智能体式的组内贡献归因,并结合测试用例和评分细则来提供奖励。面对多种任务和多条执行轨迹,评判系统需要提供有区分度的反馈,帮助模型从不同尝试中学习更有效的任务执行策略。
更细致的奖励分配机制,可以帮助模型学习更有效的执行路径。
从页面中的指标变化来看,MiMo-V2.6 的奖励相关指标正在随着训练推进而提升。
例如,从 critic/rewards/mean 曲线来看,Pro 的平均奖励由训练早期的约 0.55 提高至 0.582,Flash 则由约 0.52 提高至 0.570,两条曲线均在波动中整体上升。
除了展示训练过程,罗福莉公开的训练页面还透露了 MiMo-V2.6 当前的能力变化。
截至发稿前,从该训练面板的数据来看,MiMo-V2.6-Pro 当前的 DeepSWE v1.1 benchmark 得分为 63.72,MiMo-V2.6-Flash 得分为 60.77。
DeepSWE 主要用于测试模型的软件工程能力,包括代码理解、修改以及复杂开发任务的处理。
与此同时,训练页面中的上下文长度指标也在持续增长。 其中,ctx_total_length 数据显示,MiMo-V2.6-Pro 当前的平均上下文长度已接近 10 万 Token,Flash 版本也超过了这一规模。
对于 Agent 模型而言,长上下文能力意味着模型可以持续记住此前的操作步骤、工具反馈以及任务状态,这也是完成复杂工作的基础。
值得注意的是,此次小米公开的是训练过程,而非最终的模型成绩。
过去,大模型公司通常只在模型发布时公布参数、榜单成绩和应用案例,训练过程往往处于黑盒状态。此次罗福莉分享实时训练页面,让外界能够看到模型训练中的计算规模、任务组成以及能力变化。
目前,Pro 和 Flash 的训练仍在继续。
随着曲线延伸,我们将能持续追踪三个关系:计算投入与能力提升的关系,执行长度与任务效果的关系,以及环境多样性与模型适应能力的关系。
罗福莉提出的“强化学习能扩展多远”,也将通过这些关系逐步得到解答:增加的计算,能否让模型在更多环境中,更稳定、更高效地完成复杂任务。
本文来自微信公众号“APPSO”,作者:发现明日产品,36氪经授权发布。