小米今日凌晨正式发布并开源 Xiaomi MiMo-V2.6 系列大模型,包含 Pro 与 Flash 两个原生全模态模型,原 V2.5 系列的 API 定价保持不变:
Flash 版本每百万词元输入 1 元、输出 2 元;Pro 版本输入 3 元、输出 6 元,并提供 99% 缓存折扣。据官方介绍,在同等智能水平下,价格仅为海外模型的 1/20 至 1/60。
性能方面,MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index(AA 综合智能指数)v4.3.2 中取得 46 分,超过 Kimi K3 的 44 分和 GLM-5.3 的 45 分,成为当前 AA 指数上排名最高的开源权重模型,较前代 MiMo-V2.5-Pro 的 26 分高出 20 分。小米官方同时说明,该模型与 Claude Fable 5.1、GPT-6 Astra(均为 53 分)等顶级闭源模型相比仍有差距。
官方表示,MiMo-V2.6 在 RL 阶段可能是目前国产开源模型中投入 RL 算力最多的模型之一。Pro 与 Flash 训练历时不到 6 天,成本分别约 262 万美元与 85 万美元,各完成 30 步,累计约 75 万条轨迹;训练任务平均通过率分别相对提升 25% 和 12%,样本外的长程软件工程评测基准 DeepSWE v1.1 分别提升约 17 分(48.8 至 65.7)和约 14 分(58.4 至 72.6)。本次训练从三个维度扩展 RL 算力:单次更新使用 1568 个样本、支持 100 万上下文长度训练、单步训练 Token 达 3.5 至 3.7B;构建覆盖 Code、General、Visual、Cyber 等方向的多任务训练体系;通过 Group 内相对比较为长程 RL 任务提供更精准的奖励信号。
能力扩展方面,MiMo-V2.6 融合了 3D 空间推理、多模态感知与计算机操作能力。在游戏开发中,用户输入图片、视频或文字后,模型可将需求拆解为多个任务,由多智能体协作完成 3D 场景搭建、交互逻辑编写与视觉验证;在具身仿真环境中,模型可直接以多视角相机画面为输入,通过视觉反馈闭环控制 Franka Panda 机械臂,完成物体抓取、颜色匹配与精准放置。
科研方面,MiMo-V2.6-Pro 协助研究人员完成了全氟和多氟烷基物质(PFAS)吸附用金属有机框架(MOF)材料的设计方案筛选,并在 Lean 4 中完成了 Li-Yorke 经典论文《周期三蕴含混沌》原始主定理的完整形式化,形成 6000 余行 Lean 源码,完整证明通过 Lean 内核核验。官方强调,模型未接受过针对 Lean 的专项后训练。
伴随新模型发布,MiMo Desktop 桌面客户端(支持 Windows 与 Mac)及会员订阅方案同步上线,订阅会员可使用 MiMo-V2.6-Pro 和 Flash 模型,也可自行配置 API Key。客户端同步上线 MiMo-V2.6-Pro 的 UltraSpeed 超高速模式,提供最高 20 倍的推理速度。MiMo-V2.6 系列已上线 Xiaomi MiMo 开放平台,原邀测活动将在 1 周后结束。
小米此次全面开源 MiMo-V2.6-Pro、Flash 模型权重与技术报告,同步开放 MiMo-V2.6-Distill-Qwen-9B 及配套 RL 研究资源,包括 7k+ 高质量 RL 任务环境(覆盖软件工程、漏洞复现、知识型工作、网页设计开发四类智能体任务)、基于 verl、uni-agent 和 mini-swe-agent 的端到端 RL 训练框架,以及轻量可组合的 Harness,支持社区围绕训练算法、奖励机制和 agent harness 开展研究与迭代。
