CSDN
26-09-03 09:29 微博认证:CSDN www.csdn.net官方微博

谷歌杀疯了!Gemini 3.8 Flash 昨夜正式发布,六周内连更三款 Flash,43 天三代迭代,Jeff Dean 都走了谷歌还在疯狂卷模型,这节奏直接把 AI 圈整麻了🔥

先看硬数据,确实猛:

- LMArena Agent 榜空降第 14,微弱优势险胜 DeepSeek-V4-Pro
- DeepSWE v1.1 拿 73.7%,距 Opus 5 的 74.0% 仅差 0.3 个百分点
- Terminal-Bench 2.1 以 89.4% 反超 Opus 5 的 89.1%
- HLE-Verified 人类终极考试 54.9%,和旗舰差距肉眼可见缩小
- 输出速度 305 token/s 断层第一,几乎是第二名 Meta 的两倍
- 定价一分没涨:输入 $0.75 / 百万 Token,输出 $3.75 / 百万 Token

对一款走量定位的 Flash 来说,这表现确实超常发挥了。

但全网都在调侃谷歌这波是 "邪修"——

OpenAI 和 Anthropic 都在努力让模型用更少步骤完成任务,谷歌反其道而行:完成任务需要的步骤越来越多,主打靠 Loop 大力出奇迹。面对复杂任务,3.8 Flash 会多走几步推理、反复迭代调用工具,高 effort 档位下比前辈烧更多 Token。

代价就是:虽然 Token 单价没涨,但单任务成本 0.58 美元,比 3.7 Flash 反而涨了约 40%,每个任务平均输出 4.8 万 Token。所谓性价比,好像也没那么香了。

更尴尬的是刷分争议。在 8 月底刚出的 Terminal-Bench 4.0 上,3.8 Flash 直接拉胯到 19.1%,而 Opus 5 是 51.8%—— 老基准猛如虎,新基准原形毕露,网友直言 "纯纯刷分刷出来的"。

真正的隐藏杀器是 3.8 Flash Cyber——

谷歌史上最强网络安全模型,专攻自主挖漏洞、自动生成补丁。CyberGym 漏洞发现测试 86.2% 屠榜,覆盖 20 种编程语言的内部代码库挖洞成功率超 70%,CWE-Bench 修洞 pass@1 达 47.2%,几乎打平领跑的前沿模型(47.8%),成本却低一大截。

实战更炸裂:Chrome 安全团队拿它修洞,正确补丁数量是最强商业模型的 2.6 倍;Wiz 用它跑渗透测试,召回率提升 7.5-9.7 个百分点,花费只有其他模型的 1/2.3 到 1/5.2;最夸张的是 Google Cloud 漏洞研究团队,用它不到 2 小时就挖出一个以往需要研究数月的关键基础漏洞。

可惜能力太强,不公开发布,仅通过 Fairwind 计划向受信防御者开放 —— 又是一个只守不攻的模型。

DeepMind 姚顺宇的点评很到位:对模型来说只是一小步,对 RSI(递归自我改进)来说是一次巨大飞跃。六周三款 Flash 搞不好只是开胃菜,谷歌内部代码突击队由 DeepMind CTO 领导、联创布林直接监督,目标是逼出递归自我进化,把模型改造成全自动 AI 研究员。

而就在谷歌发模型的当口,Meta 也端出了 Muse Spark 1.3——

智能指数 62 分,与 Claude Fable 5 持平,压过 Gemini 的 59 分。编程能力优于 GPT-5.6 Sol,与 Fable 5.1 旗鼓相当,工具调用次数还减少约 20%。Meta 首席 AI 官 Alexandr Wang 直接阴阳:"Gemini,谁啊?"

前一天 Anthropic 刚发 Fable 5.1(智能指数 66 分登顶),OpenAI 在为 Astra 预热,谷歌六周三款 Flash 疯狂迭代,Meta 同日硬刚 —— 大模型三国杀,已经进入白热化了。

谷歌想重回第一梯队,光靠 "邪修"Trick 估计不够,还是坐等 Pro 吧。#极客头条#