agentzh
26-09-23 12:05 微博认证:OpenResty Inc 创始人

用我司私有的 OpenResty Coding Evals 测试多家新模型后的最新排行榜如下图所示。

Grok 4.7 xhigh 太逆天了!但我们人类专家仔细检查过其各个用例的答案后,确实挑不出什么毛病……

Claude Opus 5.5 xhigh/max 果然还是登顶了。GPT-6 Astra xhigh、Grok 4.7 xhigh、Claude Fable 5.1 xhigh 紧随其后(这三样算并列第二了)。

延时方面,claude 和 grok 模型还是最慢的……

发布于 美国