刚把我们公司内部的 OpenResty Coding Evals 测试集扩充了一下,添加了更多真实的从零编码的困难用例。现在的结果更符合原先的预期了,包括各家大模型在编码 Agent 模式下的质量评分排行和总延时排行(新增了 Grok 4.5 模型):
发布于 美国
刚把我们公司内部的 OpenResty Coding Evals 测试集扩充了一下,添加了更多真实的从零编码的困难用例。现在的结果更符合原先的预期了,包括各家大模型在编码 Agent 模式下的质量评分排行和总延时排行(新增了 Grok 4.5 模型):