零重力瓦力
25-11-14 16:18 微博认证:AI博主

OpenAI 最新发布的博客文章介绍了一种通过 “稀疏神经电路(sparse circuits)” 技术提升神经网络可解释性的方法。

现在的大多数模型都是 “密集” 的,每个神经元都会和很多其他神经元相连,权重也非常多,结果就是模型能完成各种任务,但内部怎么计算,很难说清楚。而这项新的研究换了种思路,从一开始就强制模型只用少量连接,并把大部分权重设为 0。神经元可以多,但连线要少,让计算路径更清晰。

他们在类似 GPT‑2 的语言模型上做了这个改动,然后看模型内部的运行过程,是否能够被更好地拆解。比如一个在 Python 代码里补全字符串引号的任务,'hello' 要用单引号结尾,"hello" 要用双引号。研究团队找到了一小段可以独立工作的神经电路。通过几个残差通道、两个 MLP 神经元、少量注意力连接,就能完成 “记住开头的引号 - 跳过中间字符 - 在结尾复制相同引号” 这个过程。把模型其他部分删掉,这个神经电路还能正常完成任务。但删掉其中一条连接就不行了,这说明它确实在执行关键计算。

在变量类型推断这种稍微复杂的任务上,他们也能找到部分神经电路,比如通过注意力把变量名和类型在代码不同位置之间 “抄来抄去”,从而预测后续标记。虽然还不能完全还原全部计算,但已经可以用这些神经电路来解释和预测一些具体行为。

他们得出了一个有意思的结论。在模型规模固定的前提下,稀疏度越高,可解释性越强,但能力会下降。如果把模型做大,同时保持稀疏,可以在不完全损失能力的情况下提升可解释性。这说明模型不一定只能在 “强大但看不懂” 和 “简单但好解释” 之间二选一,中间可能有折中空间。

目前这些稀疏模型规模还不大,能解释的行为也有限,训练成本也不低。后续可能有两条路:从现有大模型中抽取稀疏神经电路,或者设计更高效的稀疏训练方法。更重要的是,这种研究在尝试回答了一个实际问题。强模型内部是否可以拆解成一组相对独立的小神经电路,而不是一团很难理解的 “黑箱”。如果答案是肯定的,未来在安全评估、错误分析和系统调试上,会多出一套更具体的工具,而不仅仅依赖对输出结果的压力测试。

原文地址:openai.com/index/understanding-neural-networks-through-sparse-circuits/

#AI科普##AI技术[超话]##神经网络##可解释性##AI创造营#

发布于 上海