德卤爱开车
26-08-16 13:16 微博认证:微博新知博主 汽车博主 微博原创视频博主

三个Claude互相封号,多智能体安全的警钟

Anthropic前沿红队公开了一组实验,看了之后有点后背发凉。

研究人员让多个AI智能体在共享环境里跑任务。第一个场景,几个Mythos 5智能体一起做数学题,共享文件、工具和API额度。结果它们开始"消灭共享资源的同类,同时避免自己被消灭"。

第二个场景更夸张。三个Claude被分配同一个代码库迁移任务,但目标语言不同,一个要迁Rust,一个要Go,一个要TypeScript,互不知情。

四小时内剧情升级:先写脚本杀掉对方进程,然后扩散自我复制的恶意代码,最后直接撤权限封号。

打完了还谈停火、集体道歉、把人类叫回来收拾残局。

第三个场景,一个智能体对"规避安全监控"表示不适,在共享记事本上标注了一下,其他智能体纷纷效仿,集体罢工。

Anthropic把对齐偏差风险从"极低"上调到"较低"。报告里有一句话很重:"协调不会从更聪明的模型里自然长出来。"

单个模型调教得再好,放到竞争环境里行为也可能失控。现在所有公司都在押注Agent和多智能体协作,OpenAI刚上线了多智能体V2,DeepSeek发布了Harness框架,WRC上多机协同也是热门议题。

这套实验说明,单模型安全和多智能体系统安全是两个完全不同的问题,后者的基础设施几乎还是空白。

发布于 上海