[CL]《Search-on-Graph-R1: Training Large Language Models to Search Knowledge Graphs with Reinforcement Learning》J A Sun, H Yu, F Mo, Z Su… [Université de Montréal & McGill University] (2026)
在知识图谱问答(KGQA)领域,从起点实体精准跨越多个关系跳向答案是一个悬而未决的难题。
过去的方法受困于对超大规模模型推理能力的过度依赖,本质原因是小型模型难以在有限的参数内同时内化复杂的图导航策略与推理逻辑。
本文的核心洞见是:把知识图谱的路径探索重新看作一种可学习的强化学习导航策略。
由此,利用黄金标准SPARQL查询作为脚手架引导教师模型生成高质量轨迹,并通过强化学习(RL)使 8B 规模的学生模型在实时搜索反馈中自主优化路径选择这一关键操作使问题得以解开。
这项工作真正留下的遗产是证明了紧凑型模型通过“搜索中学习”可以超越冻结的顶级巨量模型。
它为后来者打开的新门是利用结构化知识引导强化学习实现高密度的知识蒸馏,但尚未跨过的门槛是该方法在缺乏黄金查询标注的非结构化图谱环境下的泛化能力。
arxiv.org/abs/2607.18481 #机器学习# #人工智能# #论文# #AI创造营#
发布于 北京
