「GPT‑6 Astra 发布后多项评测分数反复调整,引发 AI 刷榜与评测透明度争议」
OpenAI 推出 GPT‑6 Astra 之后,官方持续调整多项基准评测数据。部分改动抬升 Astra 的评测得分,同时部分竞品模型分数出现下滑,行业开始质疑 “刷榜” 行为与评测结果的透明度。
OpenAI 解释,评测结果受模型版本、工具配置、推理参数、测试运行条件影响,调整是为了更真实体现模型最优性能。
斯坦福研究人员提出,反复重跑评测存在Benchmaxxing(基准刷分)嫌疑:通过调整测试条件,最大化榜单分数。
业内观点指出,大模型竞争白热化,基准跑分已经成为市场竞争的重要工具,评测的可复现性与公开透明,正成为行业亟待解决的议题。
发布于 马来西亚
