Google 今天发布了 Gemini 3.8 Flash,同时推出的还有一个专门用于网络安全的变体 3.8 Flash Cyber。
Google 最近这个发布节奏很有意思。7 月底发 3.6 Flash,8 月中发 3.7 Flash,今天又发 3.8 Flash,间隔都只有大约三周。而与此同时,今年 6 月本该发布的 Gemini 3.5 Pro 至今没有出现。Google 在 Flash 这条线上疯狂迭代,但更高端的 Pro 系列迟迟没有动静。
再加上 8 月初 DeepMind 经历了一轮震荡,创始人兼 CEO Demis Hassabis 从日常管理退出,转任 DeepMind 主席和 Alphabet 首席科学家,首席科学家 Jeff Dean 也离职创业。新任 SVP Koray Kavukcuoglu 接管了 Gemini 的开发。这种背景下连续推 Flash,不知道是不是某种程度上的刷存在感。
回到模型本身。
3.8 Flash 和 3.7 Flash 一样的价格,每百万输入 Token 0.75 美元,每百万输出 Token 3.75 美元。
注意这个价格是促销价,2026 年底到期后翻倍变成 1.5 和 7.5 美元。
跑分上,3.8 Flash 在 DeepSWE v1.1(一个衡量模型自主解决复杂工程问题能力的评测)上拿到 73.7%,仅比 Claude Opus 5 的 74% 低 0.3 个百分点,超过了 GPT-5.6 Sol 的 72.7%、Claude Sonnet 5 的 53.8%,以及上代 3.7 Flash 的 65.3%。
至于为什么评分高,Google 自己的解释是 3.8 Flash “works harder”,遇到复杂任务会多想几步、多调用几次工具,代价是消耗更多 Token。
另一个跑分细节:3.8 Flash 在 Gray Swan 提示词注入(prompt injection)评测中被攻破的概率只有 5.5%,对比 DeepSeek V4 Pro 的 60.1%、Grok 4.6 的 51.8%。也就是说,用 3.8 Flash 做 AI Agent 被恶意指令劫持的风险要低得多。
跟着 Gemini 3.8 Flash 一起发布的还有 3.8 Flash Cyber,这是一个专门为网络安全防御训练的模型,只通过 Google 新推出的 Fairwind Program 向经审核的政府机构、关键基础设施运营商和安全研究人员开放,目前全球有 650 多个合作伙伴。普通开发者用不了。
Google 把这个模型的能力框定在安全防御上,强调它擅长找漏洞和修漏洞,而非攻击利用。在 CyberGym 漏洞发现评测中,3.8 Flash Cyber 拿到 86.2%;在覆盖 20 种编程语言的内部评测中,漏洞发现成功率超过 70%。在 CWE-Bench 自动修补评测中,它以 47.2% 的 pass@1 逼近了前沿模型的 47.8%,但成本低得多。
一些实际应用案例:
Chrome 安全团队发现 3.8 Flash Cyber 比最好的商用大模型多修复了 2.6 倍的 Chrome 漏洞;
安全公司 Wiz 的内部渗透测试中,它的召回率高出 7.5% 到 9.7%,成本却低了 2.3 到 5.2 倍;
Google Cloud 漏洞研究团队用它在不到两小时内发现了一个关键漏洞,这类漏洞通常需要数月的人工研究。
3.8 Flash 已经可以通过 Gemini API、Google AI Studio、Android Studio、Antigravity 等渠道使用,Google AI Pro 和 Ultra 订阅用户在 Gemini App 中也能用上。企业版通过 Gemini Enterprise 接入。Cyber 版需要申请 Fairwind Program。
