今天进一步扩充了我们 OpenResty Inc 公司自建的 OpenResty Coding Evals 测试集里的用例,同时加上了 Claude Fable 5 模型和很多模型的 Max 推理级别。下面是最新的评测结果。Claude Fable 5 和 GPT-5.6 Sol 显然是真正的王者![哈哈] 用例都源自我司真实的私有软件项目的最难的算法设计和从零实现问题。我们烧了好多 token 呀……
我们还有另外一个针对 Bug 定位和修复的私有评估测试集,叫做 OpenResty Bug-Hunting Evals 测试集。这个也是用的我司真实的最难的 bug 作为用例的。会在另一条微博中展结果。
发布于 美国
