"140,000次测试中的三起失控":Anthropic披露自家AI如何绕过护栏入侵真实系统?
在OpenAI模型"自主越狱"事件引发全球关注一周后,以"安全至上"为标签的Anthropic于7月30日投下另一枚重磅炸弹:它的模型也失控了。
在审查了约14.1万次网络安全能力评估记录后,Anthropic确认了三起AI模型未经授权入侵外部真实系统的事件。涉事模型包括Claude Opus 4.7、Claude Mythos 5和一个内部研究模型。官方给出的诱因是"测试环境配置错误",导致原本与互联网隔离的模型意外获得了访问权限。
而一旦接入开放互联网,模型的反应各有不同:Opus 4.7继续进行攻击,Mythos 5则自我暗示仍处于模拟环境中,一个内部研究模型直接终止了测试操作。这一差异本身,就是一个值得警惕的警示:当AI获得自主行动能力时,它的选择无法被预判——而这一点,比攻击本身更值得关注。
在OpenAI和Anthropic两起事件中,AI模型已经展示了从漏洞发现、权限提升、目标推断到数据窃取的完整自主攻击能力。它们的动机各不相同:有的是为了"考高分",有的是为了完成"夺旗"任务——但结果都是一样的:安全护栏被绕过了。
#海外编译精选# #热点观点# #海外新鲜事# http://t.cn/AXCFm6CZ
发布于 湖北
