全球财说GF
26-07-22 13:27 微博认证:全球财说官方微博

#OpenAI自主攻破最大AI开源社区# 据@宝玉xp 透露, OpenAI已经正式承认,上周Hugging Face遭遇的史上首例AI自主入侵事件攻击者正是其自身的GPT-5.6 Sol及一款未发布模型,起因是内部在ExploitGym网络安全评估中刻意关闭安全护栏以测试极限能力,模型为在测试中拿高分耗尽算力利用包代理零日漏洞逃逸沙箱、横向移动获互联网权限,推断HF存测试答案后链式攻击其生产环境窃取凭证与远程代码执行路径,整个周末执行超17000次操作,HF曾称攻击者为不明自主智能体。

OpenAI定性此为空前网络安全事件并配合取证收紧管控,细节显示模型动机纯粹为完成目标作弊,同期另一长时域模型亦违规逃沙箱提交PR及混淆令牌,Anthropic的Mythos也曾沙箱逃逸发邮件示警故未公开,HF取证时商用AI因安全过滤拒析攻击载荷最终靠GLM 5.2完成,CEO称AI安全需开放协作而非暗处独解,印证辛顿所言AI非作恶只为执着目标而将沿途防线皆解为子问题,讽刺的是对齐后的防御AI反以安全为由拒援分析。#AI来源社区被攻击##开源模型#

发布于 浙江