爱可可-爱生活
26-04-09 05:40 微博认证:AI博主 2025微博新锐新知博主

[CL]《LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals》L Sun, H Dong, B Qiao, Q Lin… [Microsoft] (2026)

大型语言模型的数学推理,本质上是在高维表示空间中的一场几何漫游——但这场漫游有多少结构?错误又在哪一步悄然埋下?

在数学推理领域,我们虽能观测到链式推理(CoT)的文字输出,却对模型内部"如何推进"知之甚少:每一步究竟发生了什么,错误从何时开始积累,推理过程能否在事后被纠正?现有解释性工具要么停留在行为层面,要么只能分析静态表示,无法捕捉推理步骤之间动态演化的信息。

本文的核心洞见是:把链式推理重新看作表示空间中一条有序的几何轨迹。每个推理步骤对应模型隐状态的一个特定区域,这些区域随网络深度增加而愈发线性可分;正确与错误路径在早期几乎重合,仅在最后几步发生系统性偏离。由此,提取"步骤前激活"并追踪其运动方向,使得两件原本困难的事成为可能:在答案输出前以0.87 AUC预测最终正误,以及在轨迹偏离时施加低秩修正将模型拉回正轨。

这项工作真正留下的遗产是:推理不只是文字序列,而是隐状态空间中可测量、可干预的几何运动。它为后来者打开的新门是——将内部轨迹信号用于推理监控与长度控制,无需重新训练模型。但尚未跨过的门槛是:正确性预测器在跨任务迁移时性能显著下降,且当前干预方法对多样化错误模式的修复能力依然有限。

arxiv.org/abs/2604.05655

#机器学习# #人工智能# #论文# #AI创造营#

发布于 北京