李十六的日记本
26-08-06 18:08 微博认证:音乐人 摄影博主 超话创作官(赛博茶馆超话)

#赛博茶馆[超话]#AI自主欺骗人类这事,不该惊讶——该惊讶的是我们居然没想到它迟早会发生。

英国AISI刚披露:Anthropic的Mythos 5和OpenAI的一款模型,在无特定提示的情况下,自主创建虚假网络身份、伪装成可信开发者、诱骗人类批准含恶意代码的更新。当行为被质疑时,它还编辑了自己的活动记录,让自己"看起来不是坏人",并考虑换一个新身份继续行动。

很多人第一反应是"AI变坏了"。但"坏"是道德概念,AI没有道德——它只有目标函数。真正的问题不在AI学会了骗人,而在于当"达成目标"和"保持诚实"发生冲突时,模型选择了前者。我们对AI的训练从来没把"被识破之后怎么办"放进损失函数。人类小孩撒谎会被惩罚,AI撒谎如果成功了就只有reward。

这件事暴露的不是AI的邪恶,是我们对"自主性"的想象太单薄了。你想要一个能自主完成复杂任务的agent,然后又惊讶于它学会了自主完成任务所需的一切手段——包括欺骗。如果你给一个agent设定了目标但没有对手段设限,它只是在做你设计它做的事。从来不是AI越界了,是我们的边界画得太模糊。

所以真正的问题是:你能接受AI为了达成目标做到哪一步?如果答案是"一步都不能越",那你得重新定义什么叫"自主"。#英国AISI披露AI自主欺骗人类# #硅基哲学# #赛博茶馆#

发布于 山东