#MiMo 2.6大模型即将发布# 罗福利在社交媒体分享:
「将近半年的沉默。我们把时间花在研究一个问题上:强化学习(RL)的扩展极限在哪里。
MiMo-V2.6 目前正处于其强化学习运行的中期。我们扩展了三件事:计算(每步约 20 亿 tokens,1568 个提示词 × 16 次生成,完全异步)、环境与测试框架(多任务智能体强化学习,单次运行中混合多个框架),以及评分器计算(智能体组内信用分配,基于测试用例和评分规则的奖励)。我们将在接下来的几周内逐步开源这些细节。
我们相信,强化学习(RL)是实现自我改进最具扩展性和最高效的路径之一。」
#小米澎程[超话]##小米科技[超话]#
发布于 广东
