《硅谷 101》#视频播客开麦计划#
聊聊大模型可解释性研究里的稀疏自编码器 SAE。
简单来说,SAE 的目标,就是把大模型内部一层层复杂向量,拆解成更容易看懂的特征,理想状态下,每一组数字对应一个明确概念。
但现实远没有理论那么完美:同样数据训练出的 SAE,结果也会不一样,特征很难做到一一对应单一含义。 http://t.cn/AXO7Pak3
发布于 福建
《硅谷 101》#视频播客开麦计划#
聊聊大模型可解释性研究里的稀疏自编码器 SAE。
简单来说,SAE 的目标,就是把大模型内部一层层复杂向量,拆解成更容易看懂的特征,理想状态下,每一组数字对应一个明确概念。
但现实远没有理论那么完美:同样数据训练出的 SAE,结果也会不一样,特征很难做到一一对应单一含义。 http://t.cn/AXO7Pak3