小米 MiMo 大模型负责人罗福莉今日对外公布了 MiMo‑V2.6 的最新进展:
自今年 4 月开源 MiMo‑v2.5 版本之后,小米团队沉寂近半年,核心聚焦研究强化学习的能力边界问题。目前 MiMo‑V2.6 还处在强化学习训练的中间阶段,团队在三个维度完成能力扩展,计算层面每步约消耗 20 亿个 Token,采用 1568 个 Prompt 搭配 16 条 Rollout,实现完全异步运行;环境与工具上落地多任务智能体强化学习,可以单次运行混合多个框架;同时升级 Grader Compute,为评分环节增加算力,采用 Agentic In‑group Credit Assignment 机制,配套测试案例以及评分标准奖励体系。小米表示,会在接下来几周逐步开源这批技术细节。
除此之外,罗福莉还直接公开了 MiMo‑V2.6 的训练直播页面,包含 MiMo‑V2.6‑Pro 与 MiMo‑V2.6‑Flash 两个版本,页面可查看训练进度、Token 消耗、训练成本、样本数量与各项内部指标,当前整体训练总花费已经超过 125 万美元,折合人民币约 840.3 万元。
发布于 四川
