番茄酱爱番茄
26-09-22 12:23 微博认证:娱乐博主

#小米MiMoV2.6开源最强##跨界破圈热点共创##微博垂直热点造浪计划#

小米 MiMo-V2.6 于 2026-09-22 发布并开源,主打“原生全模态 + 1M 上下文 + 大规模 Agent RL”,放权重、技术报告、7000+ RL 环境、训练框架。

一、发了什么

• Pro:稀疏 MoE,公开汇总多写总参约 1.02T、激活约 42B;原生支持文本/图像/视频/音频,上下文 1M。

• Flash:MoE 总参约 309B、激活约 15B,同样全模态+1M,定位“性价比执行”。

• Distill-Qwen-9B:小模型蒸馏版,MIT,适合本地/端侧 Agent 试验;GGUF 4-bit 约 15GB 显存可跑。

• 附加:技术报告、7000+ RL 任务环境、verl/mini-swe-agent 类训练框架、轻量 harness;Pro 还有 UltraSpeed(最高约 20× 输出,价格更贵)。

• 协议:权重 MIT,可商用;HF 组织 XiaomiMiMo。

参数注意:部分自媒体写 Pro 524B/Flash 159B,与多数公开汇总(1.02T/42B、309B/15B)不一致,以 HF 模型卡和官方技术报告为准。

二、“最强”准确说法

• Artificial Analysis Intelligence Index v4 类榜单:Pro 约 46 分,在“开放权重/开源权重”组超过 GLM-5.3(45)、Kimi K3(44),同分数段还有 Grok 4.7 等;但闭源顶档 Claude Fable 5.1/GPT-6 Astra 约 53,仍差一截。

• 官方自测 Agent 向:DeepSWE v1.1 Pro 约 71.9/72.6(RL 后)、Flash 65.7–67.9;Toolathlon-Verified 76.9;OSWorld-Verified 82.0;AutomationBench 53.1;官方称“多数 Agent 基准比肩 Claude Opus 5 / GPT-5.6 Sol”。

• 短板别忽略:Terminal-Bench 4.0 约 34.9、ProgramBench 约 26.5,低于 Opus 5;第三方逐项比对称共同覆盖 14 项里 Pro 有 10 项落后 Opus 5。所以“开源权重某榜第一”成立,“全任务超过闭源旗舰”不成立。

三、RL 做了什么(这才是重点)

不到 6 天、Pro/Flash 各 30 步、累计约 75 万条轨迹;Pro 成本约 262 万美元、Flash 约 85 万。

奖励不用二值“通过/不通过”,而是 GRS(离线建任务标准)+GAR(在线对高质量轨迹重排优势),引导更短路径、更少 token、更少“碰巧跑通”。路由器冻结+防奖励黑客,训练过程还做过直播仪表盘。

结论:V2.6 不只是“权重更聪明”,是把“代码+通用Agent+视觉+网络/安全+computer use+3D/机械臂仿真”混在一个 RL 循环里跑。

发布于 上海