爱可可-爱生活
26-02-04 05:48 微博认证:AI博主 2025微博新锐新知博主

[LG]《Interpreting and Controlling Model Behavior via Constitutions for Atomic Concept Edits》N Kalibhat, Z Wang, P Bajpai, D Proud... [Google DeepMind] (2026)

大模型在本质上仍是一个黑盒,当它给出错误答案或生成不合要求的图像时,我们往往难以追溯原因。本文为这一难题提供了新解:通过学习一份自然语言“宪法”,来解释并控制模型的行为。

理解模型不应是盲人摸象,而应是按图索骥。这份研究的核心在于将复杂的模型反馈转化为可理解、可操作的规则。

什么是原子概念编辑(ACE)?
研究者引入了 ACE(Atomic Concept Edits)的概念。这是一种针对输入提示词的微观手术:通过“添加”、“删除”或“替换”某个具体的概念,观察模型行为的变化。例如,在“草地上的羊”中替换“羊”为“山羊”,或者增加“黑色”这一属性。这种细粒度的编辑,是通往因果理解的阶梯。

学习一份“宪法”
ACE 框架的目标是学习一份自然语言形式的“宪法”。这份宪法总结了哪些系统性的提示词修改会如何影响模型的输出(如对齐度、正确性或约束遵循)。它不仅是规则的集合,更是模型内在逻辑的白皮书,告诉我们哪些策略是“好的”,哪些是“坏的”。

自动化的演进过程
该框架包含三个核心模块:
- ACE 生成模块:负责提取概念并实施微观编辑。
- 评分模块:利用自动评分器评估编辑后的效果。
- 宪法优化模块:利用大模型作为代理分类器,通过进化算法不断迭代、精炼宪法。
这种闭环设计让模型能够自发地总结出控制自身行为的规律。

揭示模型的“性格”差异
通过学习到的宪法,研究者发现了不同模型之间有趣的差异。在文本生成图像任务中,GPT-Image 更像是一个“语法家”,极度依赖提示词的逻辑结构和语法准确性;而 Imagen 4 则更像是一个“艺术家”,它优先考虑画面的整体氛围和美学连贯性。

数学逻辑的弱点
在数学推理任务中,宪法揭示了不同模型的抗干扰能力。研究发现,引入无关的干扰变量会显著误导 GPT-5,使其陷入混乱。相比之下,Gemini 2.5 和 o4-mini 则表现得更为稳健,基本不受此类干扰的影响。真正的智能不在于处理复杂,而在于过滤冗余。

从解释到控制
这份宪法不仅用于解释,更用于实战控制。实验表明,在宪法的指导下,调整模型行为的成功率比传统方法平均提升了 1.86 倍。这意味着,当我们掌握了模型的“行为准则”,我们就能更精准地引导它达成目标。解释权即控制权。

迈向可解释的未来
这项工作的意义在于,它提供了一种通用的、黑盒式的解释框架,适用于从数学推理到多模态生成的多种任务。它让我们意识到,与其在参数的海洋中迷失,不如通过自然语言建立起人与模型之间的逻辑桥梁。

arxiv.org/abs/2602.00092

发布于 北京