老刘说NLP_刘焕勇
26-08-27 23:07 微博认证:AI博主

【本体论研究趋势总结:LLM的2个缺口、11个术语及约束层、检索层、生成层3大方向根本逻辑】继续看本体相关,我们在《论文角度看本体论趋势:Ontology+Agent/RAG都在做什么?3个方向17个论文总结》(http://t.cn/AXpmIZ3x)中做了个论文索引,从技术角度,以5 组 arxiv 查询(ontology+RAG/knowledge graph+agent+RAG/ontology+agent/ontology+LLM/ontology-based+agent)共拉取 183 条结果,去重后得170篇唯一论文,然后基于这个点呢,进一步可以梳理出来一些方向,也就是本体和大模型结合。但是觉得还不够,所以再做了个进一步分析,从学术的角度上来说,科学问题是,LLM的参数里塞满了统计化的世界知识,但它是隐式、连续、非单调的:token层面万物平权,模型没有"类型系统"可违反,也没有"编译期检查"可触发。因此LLM存在两个两个真缺口:一个是推理时的结构grounding:无法被强制保证"维修对象必须是航空器部件而非人员";一个是生成时的约束执行:生成实体/关系时没有运行时闸门,会吐出不存在的实体、非法的关系、越界的值。然后呢,从形式上看,本体的本质=领域概念的类型化关系结构+约束公理,类型化关系结构=世界的类型系统/模式;约束公理=可机读的不变量。因此恰好补上上面LLM的两大缺口,所以"ontology+Agent/RAG"的根本价值不是又加一层检索,而是把"机器可解释的领域结构"提升为Agent的一等公民。由此自然分化出三个研究方向:方向一(约束层),把本体当作Agent的内核与运行时约束,治"生成幻觉/语义漂移" ;方向二(检索层),把本体当作RAG的抽取Schema与检索结构,治"图构建碎片化/多跳推理失准" ;方向三(生成层),用LLMAgent自动造/扩本体,治"本体工程的人力瓶颈",这对应本体生成环节。进一步的,这三个方向其实是个回环系统,如下:方向三造/扩本体→本体(一等公民)→方向二做抽取Schema与检索→方向一做运行时约束→一二产生的新事实/违规反馈回方向三↻。其实也是本体生成→抽取→映射→规则→约束闭环,也是知识自进化系统的落点:本体是稳定不变量(schema),知识绕着它累积与自纠。从真实落地来看,已经实现的有:约束解码/SHACL校验可用;类型化抽取提升RAG精度;LLM自举降低本体成本,这些都在真实落地。但是,吹的也不少,如声明性外壳/夸大:本体+Agent解决推理/幻觉";"方向三全自主",尚无符号回退则不成立。在此之中,所以本体的版本化、溯源、人在环策展是"一等关切",不是事后补丁。LLM强在灵活/抗噪,本体强在刚性/保证。http://t.cn/AXpmIZ3J

发布于 北京