NeFut Logo NeFut
EN 管理员登录

[AI学术] 颠覆性自动填充:用专业语言模型精准预测缺失值

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #Open Source

在数据清理中,预测表格数据中的缺失单元格值是一个基本问题。尽管最先进的推理模型在表格中通过整体推理行和列显示出巨大的潜力,但其在大规模部署时成本高昂且容易过于自信,常常生成虚假或错误的预测。

本文观察到,实现高精度的缺失值预测需要三种能力的独特组合:

  1. 世界知识
  2. 基于文本的推理
  3. 基于代码的推理

我们系统地探索了组合这些能力的设计选择,并提出了一种 Auto-Fill 方法,该方法对三个专业的小型语言模型(SLMs)进行后训练,每个模型针对一种能力进行优化。

我们开发了一种经过校准的集成机制,能够动态选择最自信的专家模型或选择不做预测,从而确保高准确性。

在11个基准测试和2200个来自不同领域的真实表格上进行的广泛实验表明,Auto-Fill 在准确性上优于最先进的推理模型(如 o3-pro、Gemini 3 Pro 和 DeepSeek R1),且其运行成本仅占这些前沿模型的不到 1%。

我们的结果突显了专业化和经过校准的弃权在表格数据这一重要领域中的有效性。Auto-Fill 的代码已在 GitHub 上公开发布。

博主点评: Auto-Fill 方法通过结合多种推理能力,显著提升了缺失值预测的准确性。这种专门化的策略不仅提高了模型的性能,同时也降低了成本,展示了在实际应用中如何有效利用机器学习模型的潜力。该研究为以后的数据清理工作提供了新的思路与方向。

原文链接: https://arxiv.org/abs/2607.19847

[h] 返回首页