GPT‑6 Astra 在 Artificial Analysis 评测指数呈现两极表现。
Coding Agent Index(代码智能体)
性能对标 Claude Fable 5,令牌效率大幅提升,较 GPT‑5.6 Sol 高70%,令牌消耗仅为前者一半。同等得分下,成本不到 Fable 5 的一半,站上代码任务成本效率前沿;Fable 5.1 依旧以70分领跑榜单。
Intelligence Index(综合智能)
综合得分61分,和 GPT‑5.6 Sol持平,低于 Claude Fable 5.1、Muse Spark 1.3。虽然输出令牌用量下降约10%,但定价直接涨到前代2.5倍:输入10美元/百万token、输出50美元/百万token(旧版4/20美元);缓存读取90%折扣保留,缓存写入加收25%溢价。令牌节省完全被涨价覆盖,单任务成本反而高出75%。
亮点:幻觉率腰斩,由92%降至51%,同时准确率上涨4分;长周期知识工作基准 AA‑Briefcase Elo提升80分,多任务、多源文件项目处理变强,但展示输出能力不及 GPT‑5.6 Sol。
表现喜忧参半:Humanity’s Last Exam上涨6分;GDPval‑AA v2 Elo回落约80分;银行客服、科学代码、超长文档推理等小项出现2‑3分退步。
发布于 重庆
