样本量的确定在机器学习预测模型中一直是难点。传统的功效分析要求事先明确预测变量与结果之间的关系以及效应结构,而非线性模型往往学习到复杂的预测面,难以直接进行解析计算。
本文提出一种框架:先用局部线性表示近似非线性模型,再在这些局部区域评估统计功效,以此推断所需样本量。
具体步骤包括:
- 训练完整的非线性模型;
- 在输入空间选取感兴趣的点,利用泰勒展开得到局部线性系数 $\beta$;
- 依据线性模型的功效公式 $$Power = \Phi\left(\frac{\sqrt{n}\,|\beta|}{\sigma} - z_{1-\alpha/2}\right)$$ 计算所需样本量 $n$;
- 将所有局部 $n$ 的上界汇总,得到全局样本量建议。
该方法兼顾模型的复杂性和统计可解释性,适用于回归和分类任务。
在模拟实验中,局部线性近似的功效估计与真实非线性模型在不同噪声水平下的误差均控制在 5% 以内。
点评