Google 这次发布了三个新模型,Gemini 3.6 Flash 无疑是最受关注的。这次,模型的设计重点并非追求最高的推理能力,而是提升单位 Token 的产出效率。
此次调整或与前代模型的使用反馈有关。3.5 Flash 虽然响应速度较快,但输出中冗余内容较多,尤其在多步骤 Agent 任务中,无效 Token 会直接增加开发者的调用成本。
3.6 Flash 针对这一问题进行了优化。根据 Artificial Analysis 的测试数据,其输出 Token 数量较 3.5 平均减少 17%。在 DeepSWE 等代码 Agent 场景中,部分任务的输出量减少可达 65%。定价方面也有所下调,输入 $1.50/1M Token,输出 $7.50/1M Token。
在压缩输出的同时,多项基准测试成绩有所提升:
1. DeepSWE 分数从 37% 提升至 49%
2. MLE Bench 从 49.7% 提升至 63.9%
3. OSWorld-Verified 从 78.4% 提升至 83.0%
其中 DeepSWE 49% 的成绩已接近 Opus 4.8 在中等推理强度下的水平,而 Flash 的定价大大低于后者。这一结果显示,在实际 Agent 应用场景中,高性价比的效率型模型正在对旗舰级推理模型形成一定竞争压力。
从综合指标看,Artificial Analysis 给出的智能指数为 50 分(第 21 名 / 共 186 个模型),推理速度达到 275.5 tokens/s,位列榜单第一。Gemini 3.6 Flash 支持 1M 上下文窗口及文本、图片、语音、视频的全模态输入,整体定位偏向实用型任务处理。在 Frontend Code Arena 榜单上,它以 1537 分排名第 12(较上一代提升 9 位),并在设计参考、工具开发和品牌营销等细分场景进入前十。
同批发布的另外两个模型定位有所不同:
3.5 Flash-Lite 主打高吞吐量(350 tokens/s,输入价格低至 $0.3/1M),面向海量文档处理和 Agentic Search 等场景.
3.5 Flash Cyber 则面向安全定制需求,仅通过 CodeMender 定向提供给政府机构和可信合作伙伴。
综合来看,此次 Flash 系列更新的主要方向不在于提升模型能力上限,而在于降低开发者的使用成本。随着 AI Agent 逐步从实验阶段进入生产环境,实际运行成本正成为与基准测试成绩同样重要的评估维度。Google 此次的产品策略应该就是针对这一趋势做出的调整。
#gemini3.6flash# #AI模型#
