我们提出了 Xiaomi-TabLDM,这是一种面向分类和回归任务的表格大模型,支持在上下文中直接学习,无需针对特定任务进行微调,即可实现更高的预测精度。模型仅在由结构因果模型(SCM)生成的合成数据上进行预训练,从而实现更灵活的上下文利用和更高效的容量扩展。\ \ 在多个基准上表现突出:在 OpenML-CTR23 上排名第一,在 TALENT、TabArena 和 BCCO 的回归任务中分别位列第二,展示了在四套互补基准中的持续强势回归性能。与此同时,Xiaomi-TabLDM 在计算成本上显著降低,例如在 TabArena 回归任务中,以第二高的 Elo 分数,仅使用 82% 的训练时间和 68% 的预测时间即可超越排名首位的 TabFM。\ \ 为提升预训练质量,Xiaomi-TabLDM 扩大了合成表格数据的覆盖范围和多样性,并采用三阶段训练策略,结合双流特征分组、轻量化 Attention Residual 和稀疏 Mixture-of-Experts,使模型能够捕获更丰富的特征交互并在不同任务间实现专家专化。\ \ 在推理阶段,模型支持计算资源的动态分配——通过在测试时增加计算量,可持续提升预测性能,超越基线模型。\ \ 点评