[AI]《Beyond Vector Similarity: Hierarchical Context-Aware Graph RAG vs Standard RAG in Enterprise Code Migration》N Jaiswal, A Agrawal, A Shukla, D Malhotra… [Google Cloud] (2026)
在企业级代码迁移领域,用 LLM
自动翻译是一个悬而未决的难题。过去的方法受困于向量检索,本质原因是它将代码库视为孤立文本,无视了跨文件的继承与调用等关键结构,导致生成的代码频繁编译失败。
本文的核心洞见是:把代码库重新看作一个确定性的结构图,而非模糊的文本语料。由此,先从代码的抽象语法树构建依赖关系,再按父类优先的拓扑顺序进行翻译,这一关键操作使跨文件依赖得以解开。
这项工作真正留下的遗产是一种新的评估范式:代码迁移的价值在于结构保真度,而非文本相似度。它为后来者打开的新门是利用图为 LLM
注入全局架构感知,但尚未跨过的门槛是这种全局视野会导致模型过度设计,牺牲代码简洁性。
arxiv.org/abs/2609.12464 #机器学习# #人工智能# #论文# #AI创造营#
发布于 北京
