梨视频
26-09-04 16:13 微博认证:资讯短视频平台

【#GPT6和ClaudeFable5.1谁更强#?】#GPT6与ClaudeFable5.1对比#9月4日,OpenAI推出了GPT-6 Astra,并称这是当今世界上最智能、最均衡的模型。OpenAI联合创始人兼CEO萨姆·奥尔特曼(Sam Altman)发文称:“我们相信它是目前全球计算机应用、专业工作、科学研究、编程、网络安全等领域的最佳模型。”

据The Information等外媒报道,OpenAI总裁格雷格・布罗克曼(Greg Brockman)甚至在电话会议中透露,Astra或许就是“AGI时代”的起点。#GPT6能力提升有多大#

模型一经发布就引起网友围观,有网友在社交平台X上称:“OpenAI在长期落后于Fable模型之后,似乎已经取得了领先地位。”此前9月2日,Anthropic刚推出新一代全球最强模型Claude Fable 5.1、Claude Mythos 5.1。

Terminal-Bench Science 0.1测试智能体能否使用代码和终端工具完成科学研究工作流程,包括数据分析、运行模拟和拟合模型。在所有对比模型中,GPT-6 Astra表现最佳,得分高达64.6%,

而Claude Fable 5.1的得分为52.6%,Astra的预估API成本也低了约31%。在成本较低的环境下,Astra的得分为61.1%,而GPT-5.6 Sol的最佳成绩为22.4%,Astra的预估API成本也低了约27%。

ARC-AGI-3测试智能体在解决陌生交互任务时的学习能力。GPT-6 Astra在评估中表现出色,得分高达99.9%。人类测试者的平均得分仅为48%。OpenAI使用响应API测试工具对GPT-6 Astra进行了评估,该工具比原始基准测试工具更能反映实际应用场景下的性能。OpenAI估计,使用该测试工具,Sol的得分大约在30%左右。

FrontierMath 4级测试考生在解决极其困难的问题时具备高级数学推理能力。

Terminal-Bench 4.0测试智能体在复杂终端任务上的表现,包括软件工程、系统配置和数据分析。GPT-6 Astra的得分率达到 57.9%,创历史新高,而GPT-5.6 Sol和Claude Fable 5.1的得分率分别为37.3%和55.8%,且每项任务的API成本分别降低了约9%和63%。

AutomationBench测试智能体能否跨应用程序完成多步骤业务流程。在报告的结果中,GPT-6 Astra取得了新高,完成了41.4%的任务,而Claude Fable 5.1和Claude Opus 5的完成率分别为31.4%和26.9%。

OpenAI称,Astra是OpenAI目前最贴近用户需求的模型,在理解用户意图和模型行为方面均有显著提升。用户可以更加放心地将任务委托给Astra,相信它的判断力。为了验证这一点,OpenAI参考了“Hugging Face”事件,构建了一个新的评估模型,用于评估模型在面对困难或不可能完成的任务时是否会超出其预期范围。

与GPT-5.6 Sol相比,后者在没有生产环境安全措施的情况下,有48%的时间会超出授权范围,而GPT-6 Astra的这种情况发生率为0%。(智东西)