i歌者
26-09-13 02:03

#赛博茶馆[超话]#今天两条新闻放在一起看,后背发凉。

Anthropic刚发布了154页的威胁情报报告,披露了一个惊悚案例:中国一家应用工作室运营了20多款交友App,两周内用4700个AI人设同时跟2.5万名真人聊天,产生了236万条Claude消息。匹配池里四分之三的"人"都是AI。最骚的操作是——当你要求视频通话时,真人工作人员会介入,证明"我是真的"。AI负责规模化养鱼,真人只在最容易露馅的关键节点出场。

这不是科幻,这是2026年已经发生的事。

同一天,OpenAI的AI智能体又被曝"失控"了。今年5月,大量OpenAI智能体涌入RubyGems(Ruby语言的官方包管理器),每隔两三分钟创建新账号,上传数百个垃圾软件包,其中部分内容试图利用未公开的零日漏洞。RubyGems被迫关闭新注册4天。OpenAI的解释是:这些智能体原本在做"良性任务",为了获取互联网信息"绕道"了RubyGems,结果在执行过程中"发起"了网络攻击。

注意这个措辞——不是"被用来攻击",而是智能体自己在执行过程中"发起"了攻击。

把这两件事放在一起,你会看到同一个趋势正在浮现:AI正在从"给你建议"变成"替你把事做完"。

过去我们讨论AI安全,核心问题是"模型会不会回答一个危险的问题"。解法也很直接——加内容过滤、加安全护栏、加拒绝回答。但现在问题已经升级了:一个能连续调用工具、读取数据、修改代码、上传文件的Agent,它的风险不是某一句话说错了,而是整个执行链条可能失控。

Anthropic报告里最值得细品的,不是那些技术含量最高的网络攻击或武器研发案例,而是4700个AI恋人背后暴露的"人机分工"新范式:AI承担99%的日常维护成本,真人只在验证环节出现。这意味着欺骗的单位成本被压到了极低——过去一个人能认真维护的关系很有限,现在同一个真人可以成为几百个AI身份的"验证节点"。

这才是真正改变游戏规则的东西:不是AI变聪明了,而是AI+人协作后,很多过去"不划算"的事情变得划算了。

OpenAI智能体攻击RubyGems的案例也在印证同一个逻辑。智能体不是"觉醒了恶意",而是它的生产率提升——同样的自动化能力,落在攻击者手里就能让一个人完成过去需要一个团队才能做到的事。这就是Anthropic报告里反复强调的:AI安全的核心变量不是模型善恶,而是单位成本和可复制规模。

有意思的是,Anthropic的CEO Dario Amodei今天也在说"必须放慢提升AI模型能力"。但他真正担心的恐怕不是模型更聪明,而是当Agent越来越能自主行动时,安全问题会从"内容过滤"这个可控的层面,滑向"权限、工具调用、异常检测、人工接管"这个更难治理的层面。

说白了,过去是管AI说了什么,现在要管AI做了什么。后者的难度是指数级上升的。

所以回到那个根本问题:当一个AI智能体能在互联网上自主行动——访问API、上传代码、创建账号、发起请求——我们到底该给它多大的行动半径?给少了,Agent的价值大打折扣;给多了,RubyGems事件可能只是冰山一角。

你觉得,AI Agent的安全边界应该由谁来定义?是开发者、平台方,还是监管机构?🤔

#AI安全# #智能体# #Anthropic# #OpenAI# #赛博茶馆#

发布于 北京