36氪
26-09-20 08:00 微博认证:36氪官方微博

【谷歌终于支棱起来了,Gemini 4 Pro空降Arena榜单,13项跑分碾压GPT-6和Fable】
过去半年,大模型的排位换了一轮又一轮:GPT-6(Astra)、Fable接连把战场推进到代码、Agent和长程任务,谷歌这边却处于长期被碾压状态。

挤牙膏似的更新Flash系列,真正代表旗舰实力的Pro却迟迟没有完成换代。要知道距离Gemini 3.1 Pro发布,已经过去整整7个月。

原定6月亮相的Gemini 3.5 Pro一再延期。有报道称,Google当时仍在继续补强其Coding能力,延期已经广泛引发内部对团队迭代速度的担忧。到了7月财报会上,Google干脆提前亮牌,劈叉哥宣布,公司早已启动Gemini 4“迄今最雄心勃勃的预训练”。

9月18日消息,谷歌跳过了 Gemini 3系列的小版本更新,Gemini 4直接上阵。昨夜,多名开发者开始在Arena的匿名Battle Mode中抽到一个名为gemini-3.8-flash的模型。问题在于,真正的Gemini 3.8 Flash早在9月2日就已经正式发布,而且已经进入Arena公开榜单。

同一个名字,为什么又突然出现在匿名测试里?更反常的是,这个“3.8 Flash”展现出的能力远远高于公开版本。

很快,LuminaBench、Harshith、Qwinah等长期追踪前沿模型的测试者随后陆续将其指向Google正在测试的Gemini 4 Pro checkpoint,内部代号被曝为“Argon”。

Qwinah还通过超长JSON压力测试称,该模型能够持续输出至接近256K规模。当然,这些参数目前仍属于社区测试结果,尚未得到Google确认。

但真正把这轮讨论的预期值拉满的,还是随后流出的Arena盲测榜单。

#氪君领读# :
1、13项全能碾压Astra和Fable
2、近五分之一的价格
3、实测惊艳

详情请阅读:http://t.cn/AXOOFkAd,本文来自 “AI前线”,作者:四月。