DeepSeek(尤其V4‑Flash)存在注意力惯性(attention inertia):对历史对话上下文分配偏高注意力权重,最新用户指令的相对权重被挤压,表现就是意图识别漂移、容易被旧对话带偏,继续回答上一轮话题,忽略当前新指令 。
现象拆解
1. 不是窗口不够,是注意力分配问题
token还完整留在上下文,没有截断;但自注意力计算时,历史内容抢到大量权重,最新user消息的token权重被稀释。
通俗例子:你多轮聊医药图谱,下一轮突然让它做代码排查,它还在输出图谱分析,不是没看见你的新指令,是历史上下文的信号更强。
2. 训练与对齐带来的偏向
DeepSeek系列训练强优化长上下文记忆、多跳链式推理;代价是对“切换任务、推翻前文、全新指令”的识别鲁棒性变弱。
Claude、Qwen在同样长会话下,对末尾最新用户query的注意力占比会更高;DeepSeek更容易把历史与当前指令做加权叠加,而不是“优先执行最新指令” 。
3. 思维链(reasoning_content)放大该问题
开启思考模式后,大量模型自身思考文本进入上下文,进一步挤占注意力;旧的推理片段会持续施加影响,加剧意图偏移 。
发布于 江苏
