AI实践论
26-07-19 09:27

总结一下OpenAI 前治理研究员 Daniel Kokotajlo 的70%AI灾难概率推演:
1、十年内超级 AI 出现概率85%
2、对齐可失控率65%
3、失控后酿成重大灾难概率90%。
三者概率相乘是49.7%。
叠加全球 AI 军备竞赛、安全投入不足、监管滞后等风险修正后得出70%。
我的思考:推演链条中,第1点无法阻止,第2点是关键,第3点只是补救。
针对第2点,有训练时安全与推理时安全两类思路:
1、训练时加强安全:这类方法都会提高训练难度,降低模型能力。在当前激烈竞争的格局下,企业间面临严重的"囚徒困境",企业缺乏商业动力。
2、推理时加强安全:比如在大模型推理框架中,加入探针( Probes )机制,探查模型内部的隐藏状态。探针实时检测模型内部中间层是否激活有害概念。如果激活即判定为欺骗性对齐,及时终止模型推理。这类方法附加成本低,而且推理框架提供者有动机。这一方法在技术和商业上可行。

发布于 广东