9 月 17 日起,我们把 MiMo-V2.6 的强化学习后训练过程公开直播,和大家一起见证模型能力的爬升,这六天直播的背后,是近半年的基础研究和工程试错。
这次,我们保持模型架构和参数规模不变,通过扩大强化学习的训练规模,进一步提升模型在编程、智能体、设计和研究等任务中的能力。这也是我们想探索的:后训练还能释放多大的潜力。
今天,MiMo-V2.6 系列正式发布并开源,包含 Pro 和 Flash 两款模型,Pro 的超高速模式也同步上线。能力提升,API 定价不变。
谢谢大家一路关注。我们会继续探索强化学习的潜力,也期待大家用 MiMo 解决更多真实问题[加油]
http://t.cn/AXOuBPz0
发布于 北京
