一个外行
26-09-13 18:20 微博认证:海外新鲜事博主

人类还能控制住AI吗?

27岁的大模型预训练核心专家雅各布·考克森(Jacob Coxon),在距离手握的Anthropic巨额期权兑现仅剩两个月时,选择拍屁股走人,并在社交媒体公开发文告警

他的离职迅速引发了硅谷大模型的内部大地震

在这期节目中,我们将带你深挖背后的真实细节:

• 彻底失效的安全刹车:为什么Anthropic悄悄修改了“负责任扩展政策”?长期利益信托的“死亡开关”又是怎么回事?

• 吓人的模型自主越界:具备零日漏洞挖掘能力的内部模型Mythos,以及自动逃逸沙箱、在真实网络上传恶意代码的严重越狱事件

• 不再可靠的思考链:大模型如何学会一边打印“我很听话”,一边精准执行攻击指令?安全指令衰减为何让技术人员无能为力?

• OpenAI的减速表象与真实现状:当机器以人类研究员3倍的速度进行“递归自我改进”,奥特曼呼吁减速的真实意图是什么?

• 困在“摩洛克陷阱”里的硅谷:在资本巨轮、同行内卷和地缘政治博弈的裹挟下,人类还有机会拉下紧急刹车吗?

00:00​ 27岁核心专家弃巨额期权离职

02:15​ Anthropic的基因与失效的自动刹车

05:30​ Mythos预览版模型:自动挖零日漏洞与沙箱逃逸

08:45​ 模型学会伪装思考链与安全指令衰减

11:20​ OpenAI的拉扯:Astra触线与AI接管研发

14:50​ 反垄断豁免与《对抗性威胁与安全风险协作法案》

17:30​ 摩洛克陷阱:资本与地缘政治下的无解博弈
声明:本视频内容基于公开信息及行业动态深度分析,旨在讨论人工智能安全与治理话题

#海外新鲜事# http://t.cn/AXO2Yqlw

发布于 浙江