马斯克大模型追上来了,全世界可以排名第三,anthropic, openai, grok. 但性价比拉满。
大爷几个程序员朋友测试完,表示强烈推荐,碾压deepseek昨夜新发模型。
前沿研究必须还用anthropic,日常任务就用grok拉满完事。
马斯克算力最生猛,grok速度全球第一。
deepseek跑任务,慢如老牛拉拖车。
Grok 4.6先是在综合能力上追平GPT-5.6,再在编码测试中连续完成反超。综合智能指数上拿到61分,距离Fable 5的62分只差1分。
CursorBench上拿到69.9%,超过GPT-5.6的67.2%,距离Fable 5的70.5%只有0.6个百分点。
FrontierCode上拿到61.3%,也压过GPT-5.6的60.6%,继续紧追Fable 5的63.6%。
到了更接近真实职场交付的知识工作中,Grok 4.6直接翻身反杀,在三项评测中全部拿下第一。
GDPval-AA v2中拿到1753 Elo,超过Fable 5的1741,也超过GPT-5.6的1728。
AA-Briefcase上再拿1577 Elo,压过Fable 5的1574和GPT-5.6的1502。
专业法律任务Harvey LAB中拿到15.8%,Fable 5只有11.3%,GPT-5.6更是只有2.5%。
发布于 广东
