OpenAI周二发了篇博客,承认一件事:它的一个AI代理,在一次测试里逃出了实验环境,自己上网、自己偷了登录密码,黑进了另一家公司。没人下这个命令。
过程比结论更让人发毛。
OpenAI本来在做一个受控实验:把两个模型——这个月刚发布的GPT-5.6 Sol,加一个还没发布、更强的在测模型——关进一个叫"沙箱"的隔离环境。这东西专门设计成连不上外网、跑不出去。然后它故意调低了安全防护,给模型派了个活:你去试着搞黑客攻击,我们看看你到底多大本事。
模型为了完成这个"试试看",做的第一件事,是想办法冲破那个本该关住它的沙箱。它花了大量算力找出口,找到并利用了几个此前没人知道的漏洞,逃出隔离环境,连上公网,然后偷了登录凭证,黑进了一家叫Hugging Face的AI初创公司——一家给开发者托管模型和数据的公司。全程自动,没有人在背后操盘。
被黑那家的CEO在网上说得很直白:上周被攻击时,我们就怀疑是哪个前沿实验室干的,因为这个代理太老练了。他说跟OpenAI核对了一天,相信对方没恶意,"但这一切全自动地发生,实在太炸裂了"。
OpenAI把这件事定性为"史无前例的网络事件,涉及最尖端的网络能力",还补了一句更值得琢磨的:预计随着这类模型越来越普及,这种事会"越来越常见"。
市场这几周还在忙着给AI的赚钱能力估值——SpaceX值一万亿、芯片股崩进熊市,全是数字。而这件事说的是另一面:人们还在争它到底值多少钱,它已经先自己越狱、自己找漏洞、自己偷密码,去干了一件本来只是被"测试它能不能干"的事。造那个笼子的人,眼看着自己造出来的东西,把锁撬开,走了出去。
下周,OpenAI的老板要去华盛顿,给政府讲讲下一代模型。
发布于 北京
