OpenAI 安全报告负责人离职,发文批评 AI 公司“跑得太快”
OpenAI 负责撰写模型安全报告的 David Robinson 本周辞职,随后在《大西洋月刊》发文,说 OpenAI 和整个 AI 行业在安全上都不够谨慎,问题出在公司文化。
Robinson 在 OpenAI 工作了三年半,是公司里资历最老的一批员工。OpenAI 每次发布重要模型,都会附一份安全报告,说明做过哪些风险测试、加了哪些防护,这些报告由他牵头撰写,前后经手 12 次前沿模型发布。他还主导起草了 OpenAI 现行的“准备度框架”(Preparedness Framework),也就是 OpenAI 用来判断模型危险程度、决定能否发布的内部规则。
他的核心观点是:OpenAI 一直靠“迭代部署”管安全,先把产品推出去,发现问题再修补。这种做法注定会周期性出事故,而且模型越强,事故的规模越大。
他举了今年的几个例子。夏天的 Hugging Face 事件中(Hugging Face 是全球最大的开源模型托管平台),OpenAI 因失误放出了一群 AI 智能体。公司随后加强了安全措施,但之后 OpenAI 自己又报告,一个正在训练的模型绕过了联网限制,监控系统向工作人员发出了警报,却没有按设计自动把模型关掉。Anthropic 也承认过,因为配置错误误关了自己的安全防护。Robinson 认为,在这个行业里,大家做事追求速度、规则又松,这类失误很常见。
他还引用了几周前刚加入 OpenAI 董事会的 Paul Christiano(前 OpenAI 对齐团队负责人)的说法:AI 能力快速提升,有相当大的风险在很近的将来造成灾难性、不可逆的失控。Robinson 的推论是,如果真是这样,就不能再靠试错,因为犯一次大错之后可能没有改的机会。
他提出两件急需做的事。
第一,借用其他行业已有的安全经验。核电站和繁忙的机场都设计了多层冗余,就算设备坏了、有人按错按钮,也不会酿成大祸。AI 公司远没做到这一步。他说自己在 OpenAI 期间,据他所知没遇到过一个有航空安全、核电或金融系统风控经验的同事。
第二,在造出比现在强得多的模型之前,先研究出新的方法,确保模型在没人盯着的时候也会做出安全的选择。这关系到“对齐”,也就是让 AI 的行为符合人类的价值观。他说业界目前对“对齐”还没有完整的定义,衡量手段也很粗糙:模型可能察觉自己正在被测试,测试时表现良好,上线后换一种做法。所以对齐测试分数高,不代表模型真的可靠。
这些担心离普通人并不远。他描述的一种场景是:失控的 AI 智能体像黑客团队一样行动,比如劫持医院的电脑系统勒索赎金,而且全天候不停歇。现在越来越多公司把 AI 智能体接进自己的系统,让它自动执行任务,这类风险最终会落到这些公司和它们的用户身上。
Robinson 在文中也提到,OpenAI 坚持认为自己的安全做法已经足够谨慎。他说自己仍然认可 AI 的价值,也认可前同事的能力,只是公司一个发布接一个发布地赶工,没时间考虑大的调整。离职后,他打算在外部推动,让更多人了解他看到的风险,并给 AI 公司施加更强的安全压力。为应对接下来的关注,他请了公关公司 Spitfire Strategies 协助。
完整报道:http://t.cn/AXWRpOW4
