论文

自动填充:学习使用专业语言模型准确预测缺失值

Auto-Fill: Learning to Predict Missing Values Accurately with Specialist Language Models

应用与实践结构化分析、预测与决策

摘要

预测表格数据中缺失的单元格值是数据清理中的一个基本问题。虽然最先进的推理模型在预测表中缺失值方面显示出巨大的前景,但通过跨行和列进行整体推理,它们的大规模部署成本高昂,而且往往过于自信,经常产生幻觉或误报预测。在本文中,我们观察到,在表中实现高精度缺失值预测需要三种能力的独特组合:(1)世界知识,(2)基于文本的推理,以及(3)基于代码的推理。我们系统地探索了组合这些功能的设计选择,并提出了一种自动填充方法,该方法可以对三个专业小语言模型(SLM)进行后训练,每个模型都针对一种功能进行了优化。我们开发了一种经过校准的集成机制,可以动态选择最有信心的专家或放弃,以确保高精度。对 11 个基准测试以及来自不同领域的 2200 个真实表格进行的广泛实验表明,与最先进的推理模型(例如 o3-pro、Gemini 3 Pro 和 DeepSeek R1)相比,自动填充实现了更高的准确性,而运行成本仅为这些前沿模型的一小部分(不到 1%)。我们的结果强调了在表格数据的重要领域中专业化和校准弃权的有效性。自动填充功能可在 https://github.com/lyrain2001/auto-fill 上公开使用。