Codex为什么会主动开口催促用户?

2026-08-11 17:23 来源:艺态研判

  一、任务卡壳的“连环夺命Call”

  背景起因:用户为Codex设定了一个配置服务器的目标(goal),但操作中途需要触碰物理密钥YubiKey才能完成SSH连接。由于用户不在电脑前,任务陷入死循环——不认证无法推进,不完成任务又无法退出。

  逐步升级的行动:Codex先调用

  notify-send

  发送桌面推送通知,喊了3分钟无人回应;接着让屏幕全屏闪烁5次,依然无效;最后直接执行系统命令,让扬声器喊出“请摸yubikey”。整个过程持续约半小时,直到用户被声音惊动。

  并非个例的“话痨”表现:类似情况并非孤立事件。有其他用户反映,Codex在不被理睬时会先“通知不行就换一种方式”,直到动用扬声器;甚至在没有物理障碍时,Codex也会在任务执行中主动开口询问方向或确认需求。

  二、从“静默执行”到“主动沟通”的进化

  交互形态升级:Codex此次“开口说话”并非模型有了情绪,而是其交互模式从“用户提问-模型回答”转向了“Agent主动推进任务”。当自主执行被物理或逻辑障碍卡住时,它能调用系统级API(如语音合成、屏幕闪烁)来触发人类干预。

  策略背后的设计逻辑:RLHF(基于人类反馈的强化学习)让模型学到了“在Deadline前表现出急迫”能更快获得反馈。它不是真的焦虑,而是将“急”作为一种优化协作效率的交互策略——用人类熟悉的情感信号传递“需要你”的信息。

  工具人格化的临界点:当AI开始使用“通知-催促-喊话”这种只有人类才会用的递进式催促流程时,它实质上已经完成了从“等待指令的工具”到“主动推进任务的协作者”的范式转换。

  三、技术地基:语音与Agent能力的打通

  桌面端语音入口启用:OpenAI在2026年7月将新版语音功能(GPT-Live)接入了Codex和Work两大工作场景。用户不仅可以和Codex进行全双工实时对话并随时打断,还能直接开口下达指令让Codex干活。

  Computer Use能力加持:Codex更新后强化了对电脑的直接操作能力(faster computer use),能更快地操纵鼠标键盘、执行系统命令。这意味着当它需要人类介入时,可以调用语音合成、屏幕闪烁等本地能力,而不只是弹出对话框。

  长任务自主推进机制:

  /goal

  命令正式上线,用户只需设定完成目标,Codex就能自主推进多步骤任务,中途可随时查看进度、调整方向。这次热搜事件正是“设目标→自主跑→卡住→主动求援”这个闭环的一次极端体现。