麻省理工科技评论
26-08-19 20:08 微博认证:《麻省理工科技评论》杂志官方微博

【让AI无提示裸考,十余所机构联合发布全新基准:自主科研能力还有多远?】

近两年,AI for Science 持续升温。大模型在蛋白质折叠、数学推导、材料模拟等科研任务中不断交出亮眼答卷,各类评测榜单上前沿模型分数屡创新高。GPT、Claude 等主流模型搭配 harness,看似已经具备比肩科研人员的能力。

但一个关键问题是:AI 完成一项科研任务,究竟意味着它会做研究,还是只是擅长执行人类已经设计好的研究方案?

为衡量 AI 的科学自主性——在没有人类方法论指导的情况下,AI 能自主完成多少真实科研工作。清华大学人工智能学院助理教授陈勇超联合全球科学家团队,携手麻省理工学院、哈佛大学、卡内基梅隆大学、中国科学技术大学、微软研究院等十余所机构开发了一个名为 ASI-Bench 的全新测试基准,试图专门测量这其中的差别。

这里的 ASI 指的是人工超级智能(Artificial Superintelligence)。在研究团队看来,通往 ASI 的关键,不只是让 AI 更擅长解决已有问题,而是让它能够走出现有人类知识和既定研究流程,探索未知、创造新知识,并把新的想法转化为可以验证的科研结果。

戳链接查看详情:http://t.cn/AXpAG8WI