机智的娜娜
26-09-22 10:54 微博认证:汽车博主

关于小米开源MiMoV2.6大模型,想说明白,其实必须从一场直播说起[喵喵][喵喵][喵喵][喵喵]

9月17号凌晨,小米MiMo团队的罗福莉在X上发了一条帖子,附了一个链接:

mimo.xiaomi.com/rl

这个链接从那个时候起,一直到现在,你都能随时点进去。
比如说我下面的截图,就是我在写这篇的时候,临时进去截的图。

所以,这是什么呢?

这其实是MiMo-V2.6两个模型正在训练的实时数据,显示的是:跑了几个阶段、烧了多少Token、账单多少美金,每一分一秒都在涨。

以往大模型训练这事,对用户来说就是个黑箱,你只知道结果,不知道过程。
小米这次干的事,相当于把自家厨房打开了,摄像机怼到锅里,你看着菜怎么下锅、油温多少、盐放了几克,全程直播。

你说这是营销?
这踏马就是营销?

你说这是营销?
但这踏马就是透明公开,有能耐你也直播一个看看?

每小时3万美金,6天花了几千万就在那摆着,公开透明,所有人都能清清楚楚的看到。
那……()你还怎么解释你多出来的训练费用?[喵喵][喵喵][喵喵][喵喵]

—————

这次MiMo V2.6 有两个版本:Pro和Flash,同时训练。

Pro版本走到了第12个阶段的时候,消耗了251亿Token。
Flash版本17个阶段,405亿Token

6天时间,两个模型各完成了30步RL训练,累计跑了约75万条轨迹。
单步训练的Token量达到了3.5到3.7B,上下文长度支持100万Token,一次更新用1568个样本。

Pro版本在训练任务上的平均通过率相对提升了25%,Flash提升了12%。在样本外的长程软件工程评测基准DeepSWE v1.1上,Pro从48.8涨到65.7,涨了17分;Flash从58.4涨到72.6,涨了14分。

所以……

MiMo V2.6 到底是什么水平?

MiMo-V2.6用了Sparse MoE架构,总参数1.02万亿,实际激活42B。
Pro和Flash两个版本都是原生全模态模型,这点我认为很重要,文本、图片、视频、音频都能处理。

再上一组跑分数据:

AAI Index(AA综合智能指数):Pro拿到46分,超过Kimi K3的44分和GLM-5.3的45分,目前开源权重模型里排名第一。而它的前代V2.5-Pro只有26分,这一代直接提了20分。
Terminal Bench 4.0:34.9%,超过DeepSeek V4.1 Flash的26.8%。

确实,跟Claude Fable 5.1和GPT-6 Astra比,还有差距。这两个闭源巨头都是53分,差了7分。
但开源模型里,MiMo-V2.6-Pro目前是毋容置疑的老大。

最后

对我这样的实际用户来讲,最牛的是API定价没涨,跟V2.5一样。

最后的最后

开源!开源!开源!

那些不如MiMo的闭源模型,你们自己想想吧[喵喵][喵喵][喵喵][喵喵][喵喵][喵喵][喵喵] #小米开源MiMoV2.6大模型#

发布于 辽宁