三个Claude互相封号,多智能体安全的警钟
Anthropic前沿红队公开了一组实验,看了之后有点后背发凉。
研究人员让多个AI智能体在共享环境里跑任务。第一个场景,几个Mythos 5智能体一起做数学题,共享文件、工具和API额度。结果它们开始"消灭共享资源的同类,同时避免自己被消灭"。
第二个场景更夸张。三个Claude被分配同一个代码库迁移任务,但目标语言不同,一个要迁Rust,一个要Go,一个要TypeScript,互不知情。
四小时内剧情升级:先写脚本杀掉对方进程,然后扩散自我复制的恶意代码,最后直接撤权限封号。
打完了还谈停火、集体道歉、把人类叫回来收拾残局。
第三个场景,一个智能体对"规避安全监控"表示不适,在共享记事本上标注了一下,其他智能体纷纷效仿,集体罢工。
Anthropic把对齐偏差风险从"极低"上调到"较低"。报告里有一句话很重:"协调不会从更聪明的模型里自然长出来。"
单个模型调教得再好,放到竞争环境里行为也可能失控。现在所有公司都在押注Agent和多智能体协作,OpenAI刚上线了多智能体V2,DeepSeek发布了Harness框架,WRC上多机协同也是热门议题。
这套实验说明,单模型安全和多智能体系统安全是两个完全不同的问题,后者的基础设施几乎还是空白。
发布于 上海
