AI圈在8月12日晚间迎来了一次重磅“撞车”:DeepSeek毫无预告地亮出V4 Pro正式版,代号DeepSeek-V4-Pro-0813,而就在几小时前,马斯克的Grok 4.6也刚发布——两款几乎同时冲击顶尖性能、但价格却更具进攻性的模型,给开发者出了道新选择题。

一、性能对决:Agent与综合智力各有侧重
两款模型并非简单的“一个碾压另一个”,而是能力方向出现了明显分化。- DeepSeek V4 Pro:工程型Agent能力突出:在Terminal Bench 2.1上拿到87.9分,逼近Anthropic Fable 5的88.0分;在CyberGym(83.3分)和AutomationBench(31.8分)上甚至反超Fable 5。其DeepSWE得分飙升至62.7,较预览版的12.8提升近5倍,单次PR补丁的能独立完成度极高。- Grok 4.6:综合智力与知识工作更强:在Artificial Analysis Intelligence Index上拿到61分,与GPT-5.6 Sol Max持平,仅比Fable 5低1分;其DeepSWE得分65.9%,高于V4 Pro的62.7%。在GDPVal、AA-Briefcase等商业任务评测中表现亮眼。

二、价格差距:一款便宜到“斩杀”,一款已是“半价”
性价比是这次竞争的关键词,两者均以远低于顶尖闭源模型的价格提供接近前沿的能力。- DeepSeek V4 Pro当前价格:输入3元/百万Token,输出6元/百万Token,缓存命中低至0.025元。有实测显示,V4 Pro完成一次复杂网页生成仅花费约1.3元,而同等任务在GPT上需2.8美元(约20元)。- Grok 4.6定价:每百万输入Token 2美元,输出6美元。SpaceXAI将此定位为其他前沿模型“一半的价格”。- 关键信号:两者虽然都有价格优势,但DeepSeek已在官网预告“近期将大幅涨价”,当前的“能力升级但价格没动”状态恐怕是短期窗口。
三、开发者实战:生态兼容与体验成关键
比跑分更重要的是“能否在日常工作流中真正用起来”。- 双模式切换是V4 Pro的杀手锏:正式版支持思考与非思考模式一键切换。简单问答关掉思考秒回,复杂代码或逻辑推演开启思考提升准确率,不用换模型适配不同场景。实测显示,在Codex环境中生成的代码完成度甚至优于GPT-5.6 Sol。- Grok 4.6强在集成入口:已在Cursor等开发者工具中直接提供服务,并重点优化了长时间运行的Agent与复杂交互任务。- 取舍建议:如果你的场景是深度工程执行、批量自动化处理,V4 Pro的极致性价比与Agent落地能力更有吸引力;如果追求最高综合智力、知识工作或已在Cursor工作流中,Grok 4.6的综合表现可能更顺手。