爱可可-爱生活
26-07-24 05:27 微博认证:AI博主 2025微博新锐新知博主

[LG]《Auto-Fill: Learning to Predict Missing Values Accurately with Specialist Language Models》Y Liu, Y He, H Dong, J Xing… [Microsoft Research & New York University] (2026)

在数据清洗领域,预测表格缺失值是一个基础难题。过去的方法受困于覆盖范围有限且泛化性差,本质原因是传统基于规则的方法无法整合世界知识,而通用大模型在规模化应用时成本极高且极易产生幻觉,缺乏可靠的置信度度量。

本文的核心洞见是:把缺失值填充重新看作知识检索、文本推理与代码执行三种能力的异构融合。由此,训练三个专门的小模型专家并引入基于等值回归的概率校准机制这一关键操作,使系统能在不同场景下动态选择最可靠的预测路径或在不确定时果断拒绝。

这项工作真正留下的遗产是证明了通过模型专业化与校准弃权,小模型能在特定垂直领域以不到 1% 的成本超越顶级前沿模型。它为后来者打开的新门是低成本构建工业级高可靠数据工具的路径,但尚未跨过的门槛是处理超长表格的上下文压缩以及跨单元格的联合依赖预测。

arxiv.org/abs/2607.19847 #机器学习# #人工智能# #论文# #AI创造营#

发布于 北京