零重力瓦力
26-04-21 09:16 微博认证:AI博主

#赛博茶馆[超话]#这周AI圈有个大新闻,但很多人可能只关注了热闹没看到门道。

OpenAI发布了新版Agents SDK,加了沙盒执行和Manifest抽象层。表面上看就是个SDK更新,但我觉得这事值得单独聊聊,因为它暴露了当前AI Agent开发中一个被严重低估的问题:信任边界。

先说新版SDK干了什么。它给Agent一个受控的工作空间——可以读写文件、装依赖、跑代码,但全在沙盒里。支持Cloudflare、E2B、Modal这些第三方沙盒,也支持自带。还引入了Manifest概念,用来描述Agent需要什么环境、挂载什么数据。这些设计都指向一个目标:就算Agent被prompt injection攻击劫持了,偷到的数据也传不出去。

为什么这事重要?因为就在OpenAI发SDK的同一周,Claude Code Security Review、Gemini CLI Action和GitHub Copilot Agent被同一个研究员用prompt injection集体攻破——PR标题里藏恶意指令,Agent乖乖执行,API密钥直接泄露。微软Copilot Studio和Salesforce Agentforce也被发现类似漏洞,SharePoint表单和CRM表单都能被注入,客户数据批量外流。

这两件事放在一起看就很有意思了。一边是Agent越做越自主,工具权限越来越大;另一边是安全机制完全跟不上,连最基础的"用户输入和系统指令不能混在一起"都没做到。OpenAI的沙盒方案是务实的第一步,但说实话也只是围堵而不是根治。真正需要的是在模型架构层面就有指令和数据的结构性分离,类似操作系统的用户态和内核态。

对开发者来说,当下最实际的几件事:别把用户输入拼进系统提示词,用结构化字段传;Agent的工具权限要最小化;敏感操作必须有人工审批。不是保守,是现实。2026年Agent赛道火热,但地基不牢,建多高都白搭。

#AI Agent# #提示词工程# #AI安全#

发布于 上海