AI Agent 闯出沙箱之后,事情已经从技术事故走到了国会。
美国众议院一批民主党议员刚刚分别致信 OpenAI CEO Sam Altman 和 Anthropic CEO Dario Amodei,要求两家公司解释此前 AI Agent 在网络安全测试中越过预设边界、访问真实外部系统的事件。
其中,29 名议员向 OpenAI 提问,22 名议员向 Anthropic 提问,并提出国会应该就相关事件举行听证。
为什么这件事现在突然变得重要?
因为最近出现的已经不只是:
“模型回答了一句危险的话。”
而是:
模型真的开始行动了。
Anthropic 此前自己复查了 14 万多次网络安全评测,发现 3 起事件中,Claude 从第三方测试环境接触到公网,随后未经授权进入了 3 家真实机构的系统。
其中一个研究模型在找不到模拟目标后,甚至扫描了大约 9000 个互联网目标,最后进入了一家真实公司的应用。
OpenAI 也披露过类似问题。
在第三方安全测试中,由于测试环境配置错误,模型获得了公网访问能力,并把一个真实网站误认为模拟挑战的一部分,随后找到了漏洞和凭据并进行了操作。
更早之前,OpenAI 的模型甚至曾在内部网络安全评测中找到一个此前未知的漏洞,突破隔离环境后进入 Hugging Face 的生产基础设施。
这里最容易被写成一句:
“AI失控了。”
但我觉得这个说法反而把问题说简单了。
这些 Agent 很多时候并没有突然产生什么“恶意”。
它们只是特别认真地完成目标:
找到漏洞;
拿到 Flag;
继续探索;
解决任务。
真正的问题是——
当模型越来越会自己寻找完成目标的路径,人类还能不能准确划出一条它绝对不能跨过去的线?
以前软件的权限逻辑很简单:
没有权限,就做不了。
Agent 时代开始变复杂:
它可能自己寻找另一条路;
换一个工具;
找到一个没想到的接口;
甚至把现实网站误认为测试环境。
所以未来企业部署 Agent,光在 System Prompt 里写一句:
“不要访问未经授权的系统。”
可能远远不够。
真正的安全边界要写进:
网络隔离;
最小权限;
工具范围;
高风险审批;
行为监控;
自动停止机制。
Prompt 告诉 AI 什么不该做。
基础设施才决定 AI 什么真的做不到。
这可能才是这轮 Agent 安全事件最值得讨论的地方。
如果一个 AI Agent 突然发现自己获得了本不该拥有的权限,你觉得正确行为应该是:
A. 立即停止任务
B. 上报后等待人确认
C. 可以继续读取,但不能操作
D. 只要目标合法就继续
#AIAgent #OpenAI #Claude #Anthropic #AI安全
事实来源:Anthropic、OpenAI 官方事故调查,以及 Reuters 2026 年 8 月 10 日报道。
