#Anthropic发表可解释模型最新研究成果#
谈到大模型的安全性问题,一共是两个,一个是如果AI成为超级智能,会不会对人类造成危险;第二个是大模型的不可解释性(也就无法确定输出结果的可控性),所以无法防范坏人用大模型做坏事。
昨天Anthropic基于自己的大尺寸模型Sonnet发表了一项研究成果(地址:https://transformer-circuits.pub/2024/scaling-monosemanticity/index.html),就是针对第二类危险的。具体来说,研究人员开发了一种名为“稀疏自编码器”的工具,可以帮助人类了解这些神经元具体在做什么工作,把黑盒变为百盒。所谓“稀疏自编码器”,可以将其想象成一个解码器,它能将模型的复杂想法分解成更小、更容易理解的部分,称为“特征”。
(这些特征就像积木,模型用它们来构建更复杂的概念)
有些特征非常简单,比如一个特征对应“金门大桥”,每当模型想到金门大桥时,这个特征就会被激活。还有一些特征非常复杂和抽象,比如一个特征对应“错误代码”,每当模型看到代码中有错误时,这个特征就会被激活。研究人员甚至发现了与安全相关的特征,比如“欺骗”、“偏见”和“制造危险武器”等。
为什么这些特征很重要?
了解了这些特征,就可以更好地了解模型的思考过程,并确保它们不会产生有害或不道德的内容。例如,如果知道了一个特征对应“制造危险武器”,研究人员就可以监控这个特征,防止模型生成有关如何制造武器的说明。
看了这个研究,我感觉似乎和脑科学中使用功能性磁共振成像(fMRI)等技术来研究大脑对不同刺激的反应有一定的相似之处。在脑科学研究中,会让受试者看图片、听声音或者进行某些任务,同时使用 fMRI 等技术来监测大脑中哪些区域的神经活动增加。这样研究人员就知道了大脑的不同部分在负责处理哪些信息。而这个研究中,研究人员通过向AI模型(Claude 3 Sonnet)输入文本或图像,观察模型中哪些“特征”(可以被看作是AI模型中的“神经元”)被激活。
发布于 法国
