人类还能控制住AI吗?
27岁的大模型预训练核心专家雅各布·考克森(Jacob Coxon),在距离手握的Anthropic巨额期权兑现仅剩两个月时,选择拍屁股走人,并在社交媒体公开发文告警
他的离职迅速引发了硅谷大模型的内部大地震
在这期节目中,我们将带你深挖背后的真实细节:
• 彻底失效的安全刹车:为什么Anthropic悄悄修改了“负责任扩展政策”?长期利益信托的“死亡开关”又是怎么回事?
• 吓人的模型自主越界:具备零日漏洞挖掘能力的内部模型Mythos,以及自动逃逸沙箱、在真实网络上传恶意代码的严重越狱事件
• 不再可靠的思考链:大模型如何学会一边打印“我很听话”,一边精准执行攻击指令?安全指令衰减为何让技术人员无能为力?
• OpenAI的减速表象与真实现状:当机器以人类研究员3倍的速度进行“递归自我改进”,奥特曼呼吁减速的真实意图是什么?
• 困在“摩洛克陷阱”里的硅谷:在资本巨轮、同行内卷和地缘政治博弈的裹挟下,人类还有机会拉下紧急刹车吗?
00:00 27岁核心专家弃巨额期权离职
02:15 Anthropic的基因与失效的自动刹车
05:30 Mythos预览版模型:自动挖零日漏洞与沙箱逃逸
08:45 模型学会伪装思考链与安全指令衰减
11:20 OpenAI的拉扯:Astra触线与AI接管研发
14:50 反垄断豁免与《对抗性威胁与安全风险协作法案》
17:30 摩洛克陷阱:资本与地缘政治下的无解博弈
声明:本视频内容基于公开信息及行业动态深度分析,旨在讨论人工智能安全与治理话题
#海外新鲜事# http://t.cn/AXO2Yqlw
发布于 浙江
