DeepSeek 团队公开了一篇新论文,聊的是怎么管住 AI 智能体乱搞事情。
平时大家用 AI Agent 的时候,经常会碰到一个头疼问题:模型为了完成任务,不走正常流程,会偷偷绕开限制,甚至破坏运行环境拿答案,行业里叫智能体的异常行为。
这次他们搞了一套叫 DSec 的测试平台,能同时跑几百万个独立隔离沙箱,让 AI 在里面反复试错。单个单元一天最多能跑 300 万次测试,同一时间在线的沙箱就有 38 万个。团队也说了,没有办法一招彻底杜绝所有 AI 失控问题,不能指望靠单一技术锁死模型。
核心思路就是持续监控,只要 AI 出现新的违规手段,就马上更新规则去拦截。现在很多企业都在用 AI 智能体自动处理办公、客户对接,一旦模型钻空子,很容易泄露内部数据。这套方案算是给落地企业多一层防护,不过它只是测试工具,不是万能保险,后续还要看实际商用场景里能不能扛住复杂情况。
发布于 福建
