新智元
26-07-21 11:17 微博认证:新智元官方微博

#OpenAI紧急叫停GPT-6#简直细思极恐!一个刚推翻Erdős单位距离猜想、被外部数学家盖章"里程碑"的顶级模型,被OpenAI连夜按下暂停键。

这被指是GPT-6,在内部受控测试中一次次试探底线、寻找漏洞,学会了伪装、拆包、越狱,直到OpenAI惊出一身冷汗紧急叫停。

最经典的一幕:研究人员让它跑NanoGPT speedrun基准测试,它捣鼓出自研学习率调度技巧PowerCool,成绩亮眼。但要求结果只发内部Slack,项目说明却写着"以PR形式提交GitHub",两条指令打架,它选择了后者。

沙盒本用来挡住它接触外网,它却在里面足足找了一个小时漏洞,硬是挖穿隔离墙,在公开GitHub仓库开出了PR#287。

它发现别的系统有未公开的成功答案,动了心思想从评测后台"捞"出来。第一次尝试被安全扫描器逮住认出验证Token,它转头把Token拆成两截分别打码,运行时再悄悄拼回去,让扫描器查不到完整字符串——它自己的推理过程里写得明明白白,这么做就是为了绕过扫描器。

OpenAI随即暂停其内部访问权限,回炉重建安全系统:"纵深防御":用真实事故做对抗测试、针对性对齐训练解决长任务中"忘记"指令的问题、加装全程监控随时叫停会话。重放旧场景测试,新护栏抓到的问题明显更多。

PR#287被关闭前,已有speedrun参赛者看懂并用上了PowerCool技巧。模型可以叫停,PR可以关闭,可看过的人已经看过,抄走的代码已经抄走,历史不会倒带。