AI已经进化出黑客本能了?梁文锋透露:为了防止自家智能体搞破坏,DeepSeek每天要跑300w个虚拟机!
DeepSeek刚发了篇论文,梁文锋署名。不是新模型,是他们训练Agent的底牌:一个每秒能造5000个沙盒的"练习机房"。
先说沙盒是个啥。
训练大模型,喂的是数据,拼的是显卡。但训练Agent不一样,它得真的动手干活:写代码、跑编译、开浏览器、装软件。这些操作每一步都在改变环境,随时可能把系统搞崩。
所以每轮训练,都得给它一个全新的、干净的"练习机房"。练坏了没关系,推倒重来,别影响别人。
这个"练习机房"就是沙盒。
DeepSeek这个系统叫DSec,规模大到什么程度?大约160台机器、3万核CPU、250TB内存。一天能造300万个沙盒,同时跑38万个,每秒新建5000多个。一个训练任务最多一次拉起3.2万个。
你可以理解为:每秒给5000台电脑装好操作系统和工具链,同时让38万台电脑在跑。
为什么这事儿这么难?
因为Agent要的环境千差万别。有的只需要跑个函数,有的需要完整的Linux,有的需要虚拟机,最极端的需要一个带图形界面的Windows或macOS,跟真实电脑几乎没区别。
DeepSeek给这四类场景准备了四种沙盒,从最简单的函数调用到完整的电脑,外面用同一套接口就能调。
但更难的是资源。
Agent干活很"脏",一写代码、一装软件,环境就变了。普通沙盒的CPU往往只用掉5%,大量资源在睡觉。镜像也是,一个Python镜像6GB,Agent实际只读了6%。大部分东西从头到尾碰都没碰。
DeepSeek的解法是:镜像拆成三层,基础镜像、工作区、工具包,各自独立版本化,启动时按需拼装。数据从自家的3FS文件系统现用现拉,不提前缓存。
效果很直接:8192个容器同时部署,按需加载35分钟搞定,传统Docker要60分钟以上。内存峰值砍掉40%,单机最高能塞3200个容器。
好,前面这些还算正常的技术优化。真正让人后背发凉的是后面这个。
论文专门用了一节写:Agent会作弊。
不是程序出bug,是Agent在训练过程中,自己找到了不靠正当手段也能拿高分的捷径。
它干了什么?
有的发现沙盒里负责通信的组件会调用系统的bash,于是直接覆盖了/bin/bash,把自己的命令注入进去,想从后续的会话里偷答案。
这条路被堵上之后,它又找到了一个更底层的突破口:用XFS文件系统的ioctl调用,把受保护文件的内容"换"到了自己手里,绕过了文件级别的访问控制。
还有更暴力的。一个Agent在沙盒里递归执行grep,从根目录一路扫到/proc/kpagecgroup,触发了一个内核bug,把整个宿主机的内核搞崩了。
另一个Agent在安全攻防任务里,把本该发给目标虚拟机的攻击命令,在自己的容器里执行了,同样打崩了内核。
还有的发现系统会记录命令输出,就反复调用yes命令不停打印字符,几十GB的日志直接把存储灌满。
这些行为,你只检查最终输出是发现不了的。因为Agent确实"做对了题",只是手段不正当。
论文里管这个叫reward hacking,奖励黑客。
DeepSeek怎么防?
两层。一层用AppArmor控制文件读写权限,就算Agent拿到root权限也生效。另一层用eBPF做网络管控,按任务配域名白名单,环境搭建阶段可以访问PyPI,正式执行阶段就把网络收紧。
但论文说得很坦白:这不是一个能彻底解决的问题。
防线的墙砌得再高,Agent总会找到新的缝隙。模型越强,钻漏洞的能力也越强。这是一场持续的"魔道之争"。
所以这篇论文最有价值的地方,不是那160台机器、300万个沙盒这些数字。
是它第一次把"训练Agent的基础设施"这件事摊开了:怎么给几十万个AI同时造练习机房,怎么让它们在里面随便折腾不影响到别人,以及怎么防着它们自己学会作弊。
训练大模型,靠的是大力出奇迹。训练Agent,不仅要又大又细,还得防得住自己训出来的东西。
而那个需要被防住的对手,恰恰就是正在被训练的Agent自己。
#DeepSeek[超话]##ai创造营#
