DeepSeek V4 Pro 0813 和 Grok 4.6,谁更强?
看完两组成绩,答案并不是简单的谁吊打谁,而是两款模型的方向已经明显不同。
Grok 4.6 更像“全能旗舰”。
AA Intelligence Index 达到 61,与 GPT‑5.6 Sol Max 持平,只落后 Fable 5 一分;GDPVal、AA‑Briefcase、Harvey LAB 等商业及专业任务表现也非常亮眼。
在 DeepSWE 上,Grok 4.6 得分 65.9%,高于 DeepSeek V4 Pro 的 62.7%,复杂软件工程能力略占优势。
DeepSeek V4 Pro 则更像“工程型 Agent”。
Terminal Bench 2.1 达到 87.9,几乎追平 Fable 5;CyberGym 达到 83.3,AutomationBench 达到 31.8,在终端操作、工具调用、安全任务和自动化执行上表现非常凶猛。
需要说明的是,两张榜单使用的 Terminal Bench 版本和评测框架并不完全相同,不能把数字直接横向相减。但整体能力画像已经很清楚:
Grok 4.6:综合智力更强,知识工作更全面,更接近当前最强闭源模型。
DeepSeek V4 Pro:工程执行突出,Agent 能力强,API 成本低得多,更适合大规模自动化落地。
如果只比绝对综合实力:
Fable 5 ≈ GPT‑5.6 Sol Max ≥ Grok 4.6 > DeepSeek V4 Pro ≈ Opus 4.8。
但如果把价格和工程落地算进去,DeepSeek V4 Pro 依然是目前最具杀伤力的模型之一。
所以真正有意思的不是“DeepSeek 有没有超过 Grok”,而是国产模型与世界最强模型之间的差距,已经从代际差距变成了能力取向的差异。
一个是更强的全能旗舰,一个是更狠的工程 Agent。
#DeepSeek##Grok##人工智能##AI编程##大模型#
