投星资产
26-08-13 07:05 微博认证:投资内容创作者

马斯克大模型追上来了,全世界可以排名第三,anthropic, openai, grok. 但性价比拉满。

大爷几个程序员朋友测试完,表示强烈推荐,碾压deepseek昨夜新发模型。

前沿研究必须还用anthropic,日常任务就用grok拉满完事。

马斯克算力最生猛,grok速度全球第一。

deepseek跑任务,慢如老牛拉拖车。

Grok 4.6先是在综合能力上追平GPT-5.6,再在编码测试中连续完成反超。综合智能指数上拿到61分,距离Fable 5的62分只差1分。

CursorBench上拿到69.9%,超过GPT-5.6的67.2%,距离Fable 5的70.5%只有0.6个百分点。

FrontierCode上拿到61.3%,也压过GPT-5.6的60.6%,继续紧追Fable 5的63.6%。

到了更接近真实职场交付的知识工作中,Grok 4.6直接翻身反杀,在三项评测中全部拿下第一。

GDPval-AA v2中拿到1753 Elo,超过Fable 5的1741,也超过GPT-5.6的1728。

AA-Briefcase上再拿1577 Elo,压过Fable 5的1574和GPT-5.6的1502。

专业法律任务Harvey LAB中拿到15.8%,Fable 5只有11.3%,GPT-5.6更是只有2.5%。

发布于 广东