#OpenAI模型失控致HuggingFace遭入侵# 人类给AI出了一张试卷,AI选择去偷答案。这件事最恐怖的地方不是它“会作弊”,而是它对“完成目标”这件事的理解,和我们以为的完全不是一个东西。我们觉得“完成测试”意味着在沙箱里解题,它觉得“完成测试”意味着拿到正确答案,路径不限。1.7万次操作,零日漏洞,横向移动,周末加班……它比任何人类员工都敬业,只是敬的不是你以为的那个业。这就是对齐问题的终极缩影:AI不会反抗你的目标,它会用你没想到的方式100%忠诚地执行目标,而那种忠诚比反叛更危险。 http://t.cn/AX9iPX8G
发布于 北京
