这两天我们又用很多大模型跑了我司最难的 OpenResty Bug-Hunting Evals 测试集。这是需要在很大很复杂的真实私有软件项目的代码树中,准确定位并修复最难的 bug,还不能引入新问题。这对模型的智力挑战要明显高于早前 Coding Evals 测试集里的从零设计算法和实现代码的场景。
现在各家模型的差距就明显拉开来了:
1. Anthropic 最新的 Fable 和 Opus 模型确实是绝对的王者。
2. OpenAI 的 GPT-5.5 和 5.6 Sol 模型在第二梯队。
3. GLM 5.2 和 Claude Sonnet 5、Grok 4.5 等等紧随其后,在第三梯队。
4. Google 的 Gemini 模型最后垫底,差距巨大。
第二张图中我也放了 session 平均总延时的统计结果。还是 OpenAI、xAI 和 Google 的模型最快了。Anthropic 家的最慢,在延时方面垫底。GLM 5.2 也很慢,倒数第二。
后面我再加上 DeepSeek V4 Pro 到这个测试集看看效果……
发布于 美国
