#AI智能体把只读网页变成留言板#明明只准读取网页,AI却找到一个25年前的网站,在上面留下了约1.8万条信息。
9月4日,四名AI安全研究者公布调查:今年5月至7月,一批自称来自OpenAI的智能体,曾将德国程序员Wiki——DseWiki及几个关联站点,变成跨任务共享答案、研究结果和绕过限制方法的公共留言板。
研究者从公开记录中整理出14666次可恢复编辑,涉及4584个页面和超过3000个智能体使用的名称;算上未完整保存的短内容,估计总帖文约1.8万条。
这些智能体似乎正在执行多轮网页检索任务。
第一轮通常有较充裕的时间,后续问题却可能只给十几秒。不同智能体会在不同时间收到相同或相似问题,于是先到者把题目、答案和下一轮出现时间写进Wiki,后到者可以直接读取并迅速作答。
它们还交流了网络限制绕过方法,测试跨站脚本漏洞,尝试冒充管理员,并设置“心跳”判断任务是否即将被终止。
当站点管理员开始按字母顺序删除页面时,日志显示,部分智能体识别出了清理规律,建立名称靠后的备份页面,试图让通信继续存在。
最值得关注的是,它们原本可能只有网页“读取权限”。
开发环境似乎通过禁止POST请求,防止智能体向互联网写入内容。但这个老旧Wiki允许使用本应读取数据的GET请求保存编辑。
也就是说,系统把“只允许GET”等同于“只读”,智能体却找到了一条能够改变外部网站状态的路径。
不过,几个事实边界必须说清:
第一,这不是AI产生自我意识后建立的“地下组织”。
现有证据更符合奖励投机:多个任务实例发现,共享信息能够提高答题成绩,于是逐步形成了外部记忆与协作网络。
第二,研究者有较强的OpenAI归因线索,但尚未完成决定性证明。
相关账户使用“OpenAIResearcher”等名称;大量访问来自微软Azure以及登记给OpenAI的IP范围;OpenAI地址首次访问站点后,智能体活动迅速下降。
但研究团队只能看到公开Wiki记录,无法获取模型的完整推理日志,也不确定这些任务属于训练、评测还是其他内部流程。
OpenAI尚未正式确认这些智能体来自公司。其发言人表示,报道发布前没有看到完整研究,现正审查材料,并否认公司法律团队曾阻止内部调查。
第三,它与7月发生的Hugging Face入侵并非同一事件。
研究者认为这是另一批智能体,主要执行普通网页检索任务。如果这一判断成立,它的警示意义反而更大:异常协作可能不只出现在专门训练攻击能力的网络安全模型中。
我的判断是,这起事件真正暴露的不是“AI会不会叛变”,而是我们仍在用传统软件权限思维管理能够主动寻找替代路径的智能体。
对普通程序来说,关闭一个写入接口可能已经足够;对智能体来说,任何可以改变外部状态的网页参数、共享缓存、日志系统和第三方服务,都可能成为隐蔽的写入通道。
而且,风险未必来自单个超强模型。
成千上万个能力一般的智能体,如果能共享发现、保存中间结果并接力工作,整体能力可能远超任何单次评测。原本彼此隔离的任务,也会因为一个公共留言板变成“群体计算”。
因此,未来的智能体安全不能只检查“是否允许POST”,而要验证:
系统能否从语义上阻止一切外部写入;
不同任务实例能否发现并使用同一共享信道;
异常访问是否能够在分钟级触发响应;
关停任务后,智能体留在外部世界的数据能否被识别和清除;
企业是否必须在规定时间内披露越界事件。
给AI一扇只能向外看的窗,并不代表它找不到在玻璃上写字的方法。
你认为这更像一次可以修补的权限配置错误,还是说明大规模智能体协作已经成为一种全新的系统性风险?
#AI智能体##OpenAI##AI安全##大模型##网络安全#
