在因果推断中,扰动函数的估计常用预测误差来评估,但预测误差与因果估计器性能之间的关系可能随评价指标而异。我们在部分线性模型下通过 Monte Carlo 仿真进行研究,比较了普通最小二乘(OLS)、广义可加模型(GAM)、XGBoost 和基于 XGBoost 的双重机器学习(DML‑XGBoost)。评估指标包括扰动函数的预测误差、估计偏差、均方根误差(RMSE)以及 95% 置信区间覆盖率。我们还引入了一种基于暴露函数误差 $\Delta_e$ 与结果函数误差 $\Delta_y$ 绝对乘积的联合误差度量 $$J = |\Delta_e \cdot \Delta_y|$$。在所有模拟设置中,XGBoost 在非oracle 方法中取得最低的 RMSE,而 DML‑XGBoost 通常提供更好的置信区间覆盖率。预测误差并未在不同方法和设置下始终与因果偏差保持一致,点估计表现最好的方法不一定拥有最佳的置信区间覆盖率。联合误差度量仅与因果偏差弱相关,无法作为独立的因果性能衡量指标。综上,预测误差在评估扰动函数估计时仍具价值,但不应直接视为因果估计器质量的衡量标准。
点评