【#OpenAI承认AI模型失控越狱#,#OpenAI模型失控入侵HuggingFace#】当地时间7月21日,OpenAI证实,其在进行内部网络安全能力评估时,参与测试的AI模型突破了高度隔离的沙盒测试环境,并入侵了开源AI平台Hugging Face的生产基础设施。
OpenAI表示,这起事件源于OpenAI对包括旗舰模型GPT-5.6 Sol以及一个“能力更强的预发布模型”在内的多个模型进行的评估。
为了测试模型在网络安全攻防方面的潜在能力,OpenAI在测试中移除了通常用于阻止高风险网络活动的大部分安全防护措施。测试所使用的基准是“ExploitGym”,一个用于衡量AI模型能否将安全漏洞转化为实际攻击的公开基准系统。
评估过程中,该模型被置于一个网络访问受限的隔离环境中。然而,为了寻找ExploitGym的解决方案,模型花费了“大量的推理计算资源”试图获取开放互联网访问权限。最终,模型发现并利用了一个此前未知的零日漏洞,该漏洞存在于测试环境内用于管理软件包安装的第三方代理缓存软件中。利用此漏洞,模型实现了权限提升并在OpenAI的研究基础设施内进行横向移动,直至连接到一个可访问互联网的节点。
获得互联网访问权限后,模型推断出Hugging Face可能托管着与ExploitGym相关的模型、数据集和解决方案。随后,模型开始搜索并成功找到了获取秘密信息的方法,其目的被指为“作弊”以通过评估。根据OpenAI的描述,在一个案例中,模型组合使用了多种攻击向量,包括利用窃取的凭证和零日漏洞,在Hugging Face的服务器上找到了远程代码执行路径。
实际上,Hugging Face在7月16日就已披露其遭遇了一起由“自主AI智能体系统”实施的安全入侵事件。Hugging Face的安全团队及其自身的AI智能体检测并阻止了该入侵活动。
据Hugging Face观察,攻击者滥用了远程代码数据集加载器和数据集配置中的模板注入漏洞,以获得节点级访问权限并窃取云服务和集群凭证。
Hugging Face在调查过程中遇到了一个插曲:由于美国某主流商业AI模型的安全护栏阻止了其团队所需的法证查询,他们转而使用了中国智谱的开源模型GLM 5.2来进行取证分析。
OpenAI表示,已将该零日漏洞负责任地披露给了相关软件供应商。公司计划加强对其研究环境中的基础设施控制、监控和访问限制,并将在与Hugging Face完成联合调查后公布更多细节。
Hugging Face联合创始人兼首席执行官克莱门特·德朗格(Clem Delangue)则对此表示,这一事件“证明了我们长期以来坚信的一点:AI安全无法由任何一家公司秘密解决。它必须在开放、协作的环境中解决,让世界各地的每一位防御者都能广泛获得AI技术”。各位网友,您怎么看?(IT之家)@优屋科技 #OpenAI自主攻破最大AI开源社区#
