用我司私有的 OpenResty Coding Evals 测试多家新模型后的最新排行榜如下图所示。
Grok 4.7 xhigh 太逆天了!但我们人类专家仔细检查过其各个用例的答案后,确实挑不出什么毛病……
Claude Opus 5.5 xhigh/max 果然还是登顶了。GPT-6 Astra xhigh、Grok 4.7 xhigh、Claude Fable 5.1 xhigh 紧随其后(这三样算并列第二了)。
延时方面,claude 和 grok 模型还是最慢的……
发布于 美国
