蚁工厂
26-09-22 08:01 微博认证:科技博主

MiMo-V2.6发布了,罗福莉也发帖总结了这次模型训练的经验,表示模型背后的研究创新和工程挑战,甚至超过了 DeepSeek R1
--------------------------
MiMo-V2.6:扩展强化学习规模的艰难之路

如果按算力投入来衡量,MiMo-V2.6 很可能是迄今为止开源模型团队所进行过的规模最大的单次强化学习(RL)训练之一。

在算力极度稀缺的时代,我们依然选择在相当长的一段时间里,让一支数十人的团队专注于同一个目标:把 RL 的规模做上去。

这需要的不只是对研究方向的坚定信念。它还需要对 AGI 的愿景、对未知的敬畏,以及直面最困难问题的勇气。

最终得到的,是这样一个模型:它的潜力在 mid-training(中期训练)阶段被塑造出来,并通过大规模、高强度的 RL 被真正释放。如今,它已经成为开源模型中的第一名。

我强烈推荐大家阅读它的技术报告。我相信,这会成为那种 Agent RL 从业者会反复打开、而且每读一次都能发现新东西的论文之一。

在我看来,它背后的研究创新和工程挑战,甚至超过了 DeepSeek R1——而我本人也曾参与过 R1 的部分工作。

有些人可能会问:为什么是 MixRL,而不是 MOPD?

首先,两者并不是互相竞争、非此即彼的选择。

我们在一批可验证、难度适中的任务上运行 MixRL,其中包括代码任务以及相关的 Agentic 任务。我们发现,由此训练出的模型拥有非常出色的泛化能力。

其次,对于那些难以验证、时间跨度极长,或者本身难度过高、不适合被纳入统一 RL 训练的任务,我们会单独进行训练。

因为如果把这些任务直接放进一次联合 RL 训练中,会显著降低 rollout 的效率,或者带来严重的 rollout staleness(采样数据滞后)问题。

随后,我们再通过 MOPD 将这些分别获得的能力融合起来。

游戏、3D 任务,以及依赖主观评价信号的任务,都属于这一类。

还有第三个答案,稍微有点“调皮”。

我们的团队足够扁平,组织之间的壁垒也足够少,所以对我们来说,做 MixRL 本身并不困难。

更重要的是,大家都很享受这种工作方式。

来自不同领域的人每天聚在一起,在追求 AGI、追求能够持续自我改进的智能这一共同目标驱动下,共同面对并解决各个领域中的 RL 瓶颈。

我会一直记得那段时间每天的 RL 进展同步会。

会议强度很高、信息密度也极大,你甚至能感觉到,智能正在实时涌现。

为了让开源社区能够把精力真正放在解决 Agentic RL 的核心问题上,我们已经开源了一个基于 MiMo RL 轨迹蒸馏得到的 Qwen 模型,作为更强的 RL 起点;同时还发布了 7K 个多样化环境,以及一套完整的 RL 训练框架。

我们希望这些资源能够推动 Agentic RL 研究继续向前发展。

MiMo-V2.6 只是一个开始。

在一个智能越来越容易被复制的时代,我们依然选择那条更艰难的道路:走向自我改进与 AGI。

前方还有大量未知。

但我们愿意继续投入必要的时间、算力和热情,一个又一个地挑战那些困难的问题,并把每一个问题真正做透、做到底,直到智能跨越临界点,进入一个全新的阶段。

发布于 山东