#今天要来点数学吗?# #人工智能[超话]# 的#数学[超话]# 基础
2025年10月,罗马的GLADIA研究中心的论文http://t.cn/AXAgQ46U称他们证明了现代大语言模型的逻辑模型是可逆的,并且与普遍的看法相反,逻辑模型在推理时不会丢弃有关其输入的信息。
昨天,他们宣布相关证明经过了lean校验。
具体来说,他们主张大型语言模型(LLMs)在数学性质上是 #单射# (injective)且可逆(invertible) 的。
不同的提示(prompts)总是映射到不同的嵌入向量(embeddings),不会出现“碰撞”。
因此,可以从潜在空间中的嵌入反推出原始输入的 token。
理论依据:
Transformer 结构是由解析函数(real-analytic functions)组成的。
在初始化时,碰撞的概率为零。
梯度下降训练过程会保持这种性质。
实证验证:
他们在数十亿对提示和不同模型规模上进行了测试,没有发现两个不同提示映射到相同隐藏状态的情况。
晦涩艰深的原论文长达41页,现在他们用Flywheel 将其浓缩为 11 个节点的图谱,便于理解、复现和扩展。
Flywheel图是一种用来表示研究论文或复杂知识体系的 结构化知识图谱。Paradigm Inc 的 Flywheel 平台允许研究者把一篇长篇论文拆解成若干个“节点”,每个节点代表一个关键概念、定理、实验或结论,然后用边连接这些节点,形成一个可视化的逻辑网络。
具体到本文,如图二,1 个研究问题 + 2 个实证节点 + 3 个定理(附 Lean 4 认证)
ps 图三和图四 虽然感觉和上文大模型的可逆性有点关系,但是不大确定。
奥卡姆剃刀原理 = 解决问题时最简单的解决方案
神经网络庞大的参数空间似乎违背了奥卡姆剃刀原理,但近乎退化的费舍尔信息解释了其低复杂度。http://t.cn/A6iPtCP5
