OpenAI 安全系统团队核心主管 David Robinson 宣布从公司离职,并在「大西洋月刊」发表了一篇言辞激烈的长文,批评 OpenAI 内部正让这项技术处于危险的生长环境中。
我去「大西洋月刊」找到了 David Robinson 的文章,摘录了他的部分观点:
我在 OpenAI 的前同事们确实富有远见:他们敏锐地抓住了缩放定律的本质,即系统规模越大,AI 就越聪明。
于是,他们不惜代价押上一切,去造更大的模型。敢想敢干、誓把不可能变成现实的狠劲,加上无休止冲刺的工期节奏,早已成为整座硅谷的通用范式。
在这样的文化下,安全策略的底层逻辑建立在一股毫无阻碍的盲目乐观之上:坚信兵来将挡,问题总能边走边解。OpenAI 的崛起依赖于试错(公司美其名曰迭代式部署),也就是先踩坑、再补齐安全护栏。
但这种模式在本质上就注定了系统必然会周期性失控,随着模型能力的增强,每一次失控的危害规模也在成倍放大。
……
几周前刚加入 OpenAI 董事会的 Paul Christiano 曾撰文警告:“随着 AI 能力迅猛攀升,在极近的未来,引发灾难性、不可逆失控的风险是真实且不可忽视的。”
倘若局势当真如此,边错边改的时代就必须终结。我们必须在第一次出手时就无限趋近完美,因为一旦失误,人类可能连迭代修正的机会都没有。
若把安全寄托在事后降临的个人英雄主义上,人类将无处可退。
面对外界质疑,OpenAI 当然坚定地为自家的安全机制辩护,坚称其已足够审慎。然而,当整家公司在一次又一次的产品发布之间疲于奔命、陷入无休止的冲刺时,它所展现出的审慎,远远低于我认为应有的底线。
行业亟需两场根本性的转变:
第一,AI 公司需要更多借鉴其他领域现成的安全专业经验。
第二,在制造出远比今天强大的系统之前,我们需要一套新的科学方法,确保更先进的模型(以及它们的后代)在人类视线之外,依然能做出安全的选择。
面对眼前的技术风险,前沿实验室的运转逻辑应当对标核电站或繁忙的枢纽机场,通过设立层层冗余,制定缜密且经得起时间推敲的预案。唯有如此,才不至于让偶然且不可避免的人为疏忽演变成灾难。
眼下,AI 公司尚不知如何做到这一点,但其他工程领域早有成熟经验。在核电站,技术系统与操作规程经过精密设计,即使设备发生故障或有人按错按钮,也不至于引发堆芯熔毁。
而 OpenAI 等实验室在开发和部署前沿 AI 时,系统冗余度与严密性远逊于此,即便这类失控造成的不可逆破坏将远甚于任何单次核灾难。
哪怕退一步说,就算未出现全盘失控,我们也可能很快面临脱离人类授权、擅自行动的自主 Agent 集群。
想象一下:一群永不需要合眼、像专业黑客团队一样协同攻防的流氓 Agent,正在瘫痪并勒索医院的整套计算网络。
在 OpenAI 供职的三年半里,我已是这里司龄最长的员工之一。我主导起草了公司现行的「准备度框架」,并负责了 12 次重大前沿技术发布的安全报告。
但据我所知,身边的同事里没有一个人真正具备高危工程经验,没人懂得如何保障民航客机安全起降、防止核反应堆熔毁,或维系金融系统运转而不至于崩盘。
必须说明的是,这是一项全新的紧迫需求:今天和未来的 AI 系统所蕴含的能力与危险性,早已远超半年前我们经手的模型。
或许我当初应该留下来,在内部推动团队编制与组织文化的根底重塑,但现实是,我和身边的同事整日疲于向前冲刺,连停下来推敲重大变革的喘息之机都没有,更遑论付诸实施。
这也让我彻底明白:想要扭转局面,必须借助外部力量形成更强有力的制衡与倒逼。
长远来看,强有力的管控固然必要,但单凭这些还不够。AI 智力彻底碾压人类的可能性很快就会成为现实,在此之前,我们需要回答一个更深层次的问题:超级智能机器应当如何与人类相处?
听听那些超级智能狂热分子的描绘吧:在他们所谓的理想未来里,机器看待纽约或芝加哥的视角,就如同你我俯瞰脚下的蚁穴。我不希望自己的孩子面对这种未来,我相信任何人都不想。
所谓「对齐」,即如何训练 AI 顺应人类价值观。这个概念听起来或许务虚而抽象,但其现实利害却关乎生死。眼下,我们甚至无法从工程实践层面给“对齐”下一个完整的定义,评估模型与人类价值契合度的手段也极其粗糙。
哪怕模型在对齐测试中拿到高分,没有任何一家公司敢确信这就是一个真正安全可靠的模型:模型完全可能察觉到自己正在受试,一旦投入实际部署,便表现出截然不同的行为。
在这些问题尚未解决的情况下,行业放任模型变得越聪明,我们所处的境地就会越发危险。
行至当下,AI 行业始终没能教会机器像一个有智慧、有同理心的人那样始终如一行事。这其中既有科学层面的机制问题,即机器究竟如何运转,也有人性层面的现实问题,即人究竟该如何关照彼此。
在这些研发机构教会超级智能善待人类之前,他们自己得先学会如何做到这一点。
