Google 发了 Gemini 3.8 Flash,跑分表上 14 项拿了 8 个第一,编程和 Agent 能力大幅提升,价格只有 Opus 5 的 15%。看起来很猛,但我觉得最值得聊的,恰恰是它"没赢"的那几项。
Terminal-bench 4.0 只有 19.1%,Opus 5 是 51.8%,差了两倍多。OSWorld-2.0 也被 Opus 5 甩开十几个点。这两项测的是什么?一个是极端复杂的终端操作,一个是真实桌面环境下的自主任务执行。换句话说,越接近"让 AI 独立替你干完一整件事"的场景,Flash 和旗舰之间的鸿沟就越明显。
这揭示了当前 AI 竞争一个很有意思的分层:跑标准化的编程题、做结构化的文档分析,中端模型已经逼近甚至追平旗舰;但一旦进入开放式、长链条、需要持续决策和纠错的真实任务,算力和参数量的差距就会被急剧放大。
所以 Flash 的定位其实很精明:用旗舰 15% 的价格覆盖 80% 的日常场景,把剩下那 20% 的硬骨头留给 Opus。未来 AI 的商业模式可能就长这样,便宜的干粗活,贵的啃难题,用户按难度付费。
问大家一个问题:你愿意为那 20% 的差距多花六倍的钱吗?
另外,注意:3.8 Flash 当前输入 0.75 美元、输出 3.75 美元/百万 Token,和 3.7 Flash 一样。两项单价都只有 Opus 5 的 15%。优惠到 12 月 31 日,2027 年 1 月 1 日起翻倍。
#谷歌正式发布Gemini3.8#
发布于 山东
