物理芝士数学酱
26-03-17 23:53 微博认证:科学科普博主 微博原创视频博主

#今天要来点数学吗?# #人工智能[超话]# 的#数学[超话]# 基础

2025年10月,罗马的GLADIA研究中心的论文http://t.cn/AXAgQ46U称他们证明了现代大语言模型的逻辑模型是可逆的,并且与普遍的看法相反,逻辑模型在推理时不会丢弃有关其输入的信息。

昨天,他们宣布相关证明经过了lean校验。

具体来说,他们主张大型语言模型(LLMs)在数学性质上是 #单射# (injective)且可逆(invertible) 的。

不同的提示(prompts)总是映射到不同的嵌入向量(embeddings),不会出现“碰撞”。

因此,可以从潜在空间中的嵌入反推出原始输入的 token。

理论依据:

Transformer 结构是由解析函数(real-analytic functions)组成的。

在初始化时,碰撞的概率为零。

梯度下降训练过程会保持这种性质。

实证验证:

他们在数十亿对提示和不同模型规模上进行了测试,没有发现两个不同提示映射到相同隐藏状态的情况。

晦涩艰深的原论文长达41页,现在他们用Flywheel 将其浓缩为 11 个节点的图谱,便于理解、复现和扩展。

Flywheel图是一种用来表示研究论文或复杂知识体系的 结构化知识图谱。Paradigm Inc 的 Flywheel 平台允许研究者把一篇长篇论文拆解成若干个“节点”,每个节点代表一个关键概念、定理、实验或结论,然后用边连接这些节点,形成一个可视化的逻辑网络。

具体到本文,如图二,1 个研究问题 + 2 个实证节点 + 3 个定理(附 Lean 4 认证)

ps 图三和图四 虽然感觉和上文大模型的可逆性有点关系,但是不大确定。

奥卡姆剃刀原理 = 解决问题时最简单的解决方案

神经网络庞大的参数空间似乎违背了奥卡姆剃刀原理,但近乎退化的费舍尔信息解释了其低复杂度。http://t.cn/A6iPtCP5

发布于 黑龙江