【AGI的真正风险,不是太聪明,而是错得太像对——AGI安全治理的逻辑转向与“经验时代”的来临|2026 Science x AI Summit】
当全球科技界还在比拼算力规模,强化学习奠基人、图灵奖得主理查德·萨顿(Richard Sutton)在2026 Science x AI Summit上,直接掀开了生成式AI的底层真相。
🎯 新颖与优秀,不可兼得
萨顿用一个经典笑话开场:“这项研究既新颖又优秀,可惜新颖的部分不优秀,优秀的部分不新颖。”
这正是当下大语言模型的写照:它能模仿,能生成看似合理的输出,却无法同时做到“新颖”与“优秀”。在科学领域,发现必须同时满足二者,这是生成式AI永远跨不过去的原理性鸿沟。不是工程问题,是底层逻辑的边界。
🧩 真正的“发现”需要三步:变异、评估、选择性保留
萨顿指出,进化论、科学方法、强化学习都遵循同一闭环。而生成式AI只有随机的变异,缺失了“评估”这一环。
“新颖性闪烁出现,却因价值未被识别而转瞬即逝。”
他还点出深度学习的固有弱点:标准反向传播仅在初始化时有一次随机变异,随后网络逐渐丧失可塑性。其团队在《自然》发表的“持续反向传播”算法,通过定期重置低使用率神经元的权重,让持续学习成为可能。这也为AGI安全提供了新思路:不是从外部“踩刹车”,而是让AI内嵌自我评估机制。
🔄 从“对齐”到“内嵌”:AGI安全的范式转换
萨顿预言,AI即将进入“经验时代”。智能体将通过与环境交互自主学习,而非被动复现人类数据。
他呼吁:“把明确的目标共享给AI,让它们自主完成创造、评估、发现的循环。”
这一判断与陶哲轩的“形式化验证”、巴里什的“黑箱困境”形成跨学科共鸣。科学家不敢把LIGO的控制权交给AI,不是因为AI不够强大,而是因为它无法为自己的判断提供可信度。
未来的AGI安全,不是让AI“听话”,而是让它学会“自我验证”。
📎 更多详情,请登录SAIR官网:http://t.cn/AXJafNLC
#AI##AIforscience##陶哲轩##SAIR##科研##图灵奖##人工智能 ##AGI ##SAIRFoundation#
