每天玩AI
26-09-05 14:09 微博认证:AI博主

「GPT‑6 Astra 发布后多项评测分数反复调整,引发 AI 刷榜与评测透明度争议」

OpenAI 推出 GPT‑6 Astra 之后,官方持续调整多项基准评测数据。部分改动抬升 Astra 的评测得分,同时部分竞品模型分数出现下滑,行业开始质疑 “刷榜” 行为与评测结果的透明度。

OpenAI 解释,评测结果受模型版本、工具配置、推理参数、测试运行条件影响,调整是为了更真实体现模型最优性能。

斯坦福研究人员提出,反复重跑评测存在Benchmaxxing(基准刷分)嫌疑:通过调整测试条件,最大化榜单分数。

业内观点指出,大模型竞争白热化,基准跑分已经成为市场竞争的重要工具,评测的可复现性与公开透明,正成为行业亟待解决的议题。

发布于 马来西亚