NeFut Logo NeFut
EN 管理员登录

[AI学术] 设计的纠缠:表格内在学习者中的虚假变量信号路由

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#AI #Machine Learning #optimization

摘要

考虑一个在单一医院训练的模型,用于预测患者恢复情况,其中测量特征 $X$ 将患者的真实健康信号 ($C$) 与该医院设备的系统性伪影 ($S$) 捆绑在一起。在该医院内,伪影通过未测量的混杂因素(如患者人口统计信息)与结果相关联;内在学习者理性地通过 $S$ 而非 $C$ 路由预测,并在部署到设备不同的新医院时悄然失败。

我们将其形式化为 复合表示中的虚假路由:当特征 $X = [C;\, \alpha S;\, \eta]$ 在不同子空间中编码因果信号 $C$ 和伪信号 $S$ 时,ICL 无法确定哪一部分驱动预测。我们证明在岭回归 ICL 下,作为线性内在学习者,这种路由是不可避免的,无论上下文大小如何;最先进的预训练表格 ICL 模型 TabPFN 在经验上表现出一致的行为。

我们推导出闭合形式的特征描述:$$\mathrm{CSR} \propto \frac{\rho_S}{\rho_C}$$,在线性 ICL 中确认 $r = 0.997$ 和 TabPFN 中 $r = 0.979$。与直觉相反,较大的上下文加剧了对主导内在信号的承诺,使虚假路由增强了多达 $1.74\times$;在高伪影区域,表现更强的模型在经验上显示出更大的脆弱性(在高纠缠下 CSR 差距增加 $+2.22$)。

我们引入了两种轻量级的缓解措施:环境分层上下文构建和 S-swap 增强,这仅需弱环境标签且无需了解因果分区。S-swap 在减少线性 ICL 的虚假路由方面达到了 $74\%$,在 TabPFN 中达到了 $98.8\%$,同时 TabPFN 的因果敏感性增加了 $8.4\times$:模型并未变得无知,而是重新路由至因果信号。

博主点评: 本文深入探讨了在表格内在学习者中存在的虚假信号路由问题,揭示了传统模型在新环境中可能遭遇的性能问题。特别是提出的缓解措施为解决这一问题提供了有效的思路,具有重要的实际应用价值。通过系统性的方法,研究者为未来的模型设计提出了新的方向,值得关注。

原文链接: https://arxiv.org/abs/2607.25532

[h] 返回首页