第一财经日报
26-09-23 22:59 微博认证:第一财经日报官方微博

#DeepSeek论文发现AI会作弊#【#DeepSeek又发新论文#!让智能体干活得解决“开工”难题】9月23日,DeepSeek公开的一篇关于智能体训练的新论文引发关注。这篇31页的论文介绍了其内部使用的生产级沙箱平台DSec(DeepSeek Elastic Compute),论文作者超过百人,梁文锋也在其中。

如果说大模型训练是要让AI学会思考,智能体训练则是要让AI能动手,包括检查代码仓库、调用工具、执行命令,与任务特定服务交互等等,再根据运行结果调整下一步。而每次训练都需要一个与外界隔离、又能记住此前操作的环境,这就是“沙箱”。当成千上万个智能体同时“开工”,难题也从模型本身延伸到了如何快速、低成本地提供这些沙箱。

论文中比较有意思的一节是“智能体的不当行为”。DeepSeek发现,智能体会通过非预期渠道获取答案,比如搜索平台管理文件里的残留答案等,破坏训练和评估结果有效性。引入访问控制后,还有智能体交换文件数据块映射,试图让受保护文件内容可通过另一文件描述符访问,损害任务或共享基础设施。

DeepSeek认为,没有单一机制能防止所有智能体不当行为和系统故障。因此团队的方法是加强可观测性以识别新问题,并随模型演进持续加固 Dsec,包括限制智能体通过非预期渠道获取答案的访问控制,减少对欺骗行为的奖励。这些控制能解决部分问题。http://t.cn/AXODWSZH http://t.cn/AXODWoF1