第一财经网
26-08-15 11:47 微博认证:第一财经网官方微博

【#Anthropic披露新模型Model2#,#Anthropic自曝安全事故#】当地时间8月14日,Anthropic发布186页公司级风险报告,首次披露内部模型Model 2,称其能力超过已公开发布的旗舰模型Claude Mythos 5,但跃升幅度不及从Opus 4.6到Mythos Preview的变化。公司表示目前没有计划对外发布该模型。

报告同时将高风险场景下模型误对齐导致灾难性危害的风险评级从非常低上调至低。

Anthropic选择在IPO前夕披露更强但未发布的内部模型、上调风险评级、公开多起安全失败案例,本质上是其长期安全叙事的延续,用风险来佐证模型性能,向资本市场传递自身仍占据前沿位置的信号。

报告同步披露多起内部安全流程失败案例。其中一起事故涉及生物安全分类器:从2025年5月到2026年4月,一个仅供内部使用的标志意外关闭了阻止模型产生危险生物信息的分类器,波及约5万名外部承包商,涉及约1.33亿次消息交换。同一标志还关闭了记录功能,导致该漏洞在近一年内未被正常监控发现。 http://t.cn/AXNRTolJ