合成表格数据通常通过分布相似性、隐私距离或在合成数据上训练、在真实数据上测试的预测性能进行评估,但这些标准并不能确保因果推断的有效性。我们展示了完全生成的表格合成器,包括基于 GAN 和 LLM 的模型,能够保持预测效用的同时扭曲平均处理效应(ATE)估计。这个失败是结构性的:ATE 的保留需要现实的协变量法则和准确的处理效应对比,而预测损失仅通过重叠加权项惩罚处理效应错误。
因此,在不平衡或有限重叠的情况下,生成器可能会重现主导的观察结果,同时对干预相关对比的学习不足。我们通过敏感性和损失分解结果对这种不匹配进行了形式化。基于这一因果分析和直觉,我们提出了一种混合合成数据框架,用于因果推断,该框架在分别建模处理和结果机制的同时生成协变量。
我们在三种设置中评估该框架:完全生成与混合合成下的 ATE 保留、实际积极性问题的增强以及比较 OR、IPW、AIPW 和 TMLE 的诊断模拟引擎,均在真实数据分析之前进行。我们还在重叠、协变量维度、种子样本大小和处理效应复杂性等不同设置下对混合构造进行了压力测试,包括逻辑结果模型错配检查。
在受控的模拟实验中,混合合成相较于完全生成的基线在因果保真度上有所改善;ACTG 应用显示出更高的预测保真度和有限样本估计器基准测试的潜力。在因果保真度可以评估的设置中,基于 LLM 的混合合成通常比 CTGAN 更加可信。
博主点评: 本文深入探讨了生成合成数据在因果推断中的潜在问题,强调了数据生成过程中因果效应的保留问题。提出的混合框架不仅在理论上具有重要意义,也在实际应用中展现了提升因果推断精度的可能性,值得研究者深入探索和应用。通过对模型的敏感性分析,本文为未来的合成数据研究提供了新的视角与方向。