这两天,我用我司内部私有的更难的 OpenResty BugHunt Evals 评测集,全新评估了 GPT-6 Astra、Claude Fable 5.1、Grok 4.6、Gemini 3.8 Flash 这些新模型。看起来 Claude 模型仍是王者。GPT-6 Astra 紧随其后。
这个评测集主要考察各个大模型在全自动使用 coding agent harness 的情况下,在很大、真实、复杂的软件项目中定位和修复最困难的 bug 的能力。
有些意外的是 ,Grok 4.6 的进步也太大了,都打败 GPT-5.6 Sol 等前沿模型了。
Google 目前最新的 Pro 模型则落后太多了,绝对的垫底。而他们家的 Gemini 3.8 Flash 的表现则要好得多,在排行榜的靠近中间的位置上。 看来 G 家下面是集中力量卷便宜的小模型了 [哈哈]
在平均总延时方面,Fable 5.1 还是不错的,倒不是单次响应有多快,而是整体需要的试错步骤更少。
细节见下面两张图,左边是质量评分,右边是延时评分。
发布于 美国
