好家伙,Deepseek-V4-Pro-0813 只在 Artificial Analysis Intelligence Index 前十呆了不到 24 小时,就连夜被 Gemini 3.7 Flash 挤出来了 …
来速速看下 AA 的测评摘要:
Gemini 3.7 Flash (high) 较上代 3.6 Flash 在综合性能上提升了 4 分,斩获 56 分,目前排第九,紧追 GPT-5.6 Terra (max, 57) 与 Muse Spark 1.2 (xhigh, 57),算是回到了第二梯队吧。
Deepseek-V4-Pro-0813 掉到第十一,这次确实未达预期。
Gemini 3.7 Flash 在 AI Agent 测评中的提升尤其明显,在 medium 推理模式下,就能直接追平 Deepseek-V4-Pro-0813 (max, 53) 与 GLM-5.2 (max, 53)。low 模式下得分为 51 分,紧追 DeepSeek V4 Flash 0731 (max, 52)。
文本生成能力上,Gemini 3.7 Flash 的输出速度达到每秒约 340 个 token,几乎是 GPT-5.6 Terra 和 GLM-5.2 的 3 倍。Gemini 家族的标准艺能了,谁用谁知道。
对了,还有个需要提的地方:在复杂表格与文档分析评测 AA-AnalystAgent 中,Gemini 3.7 Flash (high) 以 60% 的连续 5 次尝试均全对的通过率摘得桂冠,领先 Claude Opus 5 (max, 54%) 和 Fable 5 (49%)。
可能有些小伙伴不知道这个评测是啥,介绍下,这个新面孔评测主要是针对 14 个不同领域(如金融、能源、大宗商品贸易等)的各类电子表格(Excel/CSV)与参考文档,进行五类高阶分析。
在普通的 AI 评估中,模型只要在多次尝试中答对 1 次就算通过。但在金融和分析领域,不稳定的表现意味着依然需要人工逐一核对。因此,AA-AnalystAgent 要求模型必须在 5 次完全独立的尝试中全部给出正确答案,才算真正攻克该任务。
Gemini 3.7 Flash (high) 在这个项目中吊打了 Fable 5,所以应该在复杂的商业表格、财务建模和数据分析中有很好的使用体验,推荐相关领域的小伙伴去试试看。
其他模型关键参数:
上下文窗口: 100 万 token(与 Gemini 3.6 Flash 保持一致)
多模态能力: 支持文本、图像、视频与语音输入,输出形式为文本
资费标准: 标准定价为 1.50 美元 / 7.50 美元(每百万输入 / 输出 token)。年底前享受限时促销价(0.75 美元 / 3.75 美元);命中缓存的输入 token 继续享有额外的 90% 折扣优惠。
妈呀,写到这太困了 …… 强烈建议海外也在我们工作时间发模型好吗?
