agentzh
26-09-05 07:37 微博认证:OpenResty Inc 创始人

今天使用我司内部的 OpenResty Coding Evals 评测集检查全新发布的 GPT-6 Astra 模型,确实在复杂问题的从零编码任务上,已经打败了 Claude Fable 5.1 了,但和 Claude Opus 5 还有一点点差距…… [笑cry]

GPT-6 Astra 的平均总用时也明显比 Claude 模型更少,响应速度更快。

排行榜上也更新了最新的 Grok 4.6 和 Gemini 3.8 Flash 模型。

我一会儿再跑一下我们另一个在复杂软件项目中定位和修复困难 bug 的 OpenResty BugHunting Evals 评测集看看。

发布于 美国