OpenAI最近发了一篇叫「An Alien Mind」的长文,中文是「一个外星心智」。
他们没有说「模型越来越强」,而是说我们造出了一个不太能完全理解的东西。
文章最直接的判断是:CoT监控能力正在减弱。
CoT就是思维链,让模型把推理过程写出来,我们看着它怎么想。这一直是AI安全最重要的监测手段。但OpenAI承认,这招越来越不管用了。
模型能把推理写得漂亮,但你很难分清它到底在「想什么」还是「表演给你看」。监控在退步,能力在前进。
OpenAI区分了目标对齐和价值观对齐。
目标对齐是模型听不听话,价值观对齐是它内在是否认同人类价值观。真正的危险在后者的泛化——遇到新情境,模型还会不会保持对人类有益的行为。
作者直言:没有人准备好应对机器智能快速上升的后果。
我们习惯了用「让模型解释自己」建立安全感,但如果连OpenAI都说防线在松动,说明我们可能高估了掌控能力。
问题不是模型会不会失控,而是我们以为能监控住,其实已经监控不住了。
#理性思考的底层逻辑 #博弈论锚定效应 #OpenAi #掌控思维
发布于 北京
