NeFut Logo NeFut
EN 管理员登录

[AI学术] 天花板在通道中:临床预测中的学习者差距与测量前沿审计

发布于:2026-09-03 22:00 最后更新:2026-09-04 02:14
#algorithm #AI #Machine Learning

临床预测的性能饱和可能由两类因素导致:一是学习算法未能充分利用已有信息,二是记录的变量本身设定了人口层面的上限。我们将这两者分别定义为 学习者差距(learner gap)和 测量通道天花板(measurement‑channel ceiling)。

在总变差(total‑variation)分离的框架下,最优的平衡准确率(balanced accuracy)可以用来区分这两类限制,从而实现模型结构不变性(architecture invariance)以及在替换污染(replacement contamination)情形下的锐利部分可识别性(partial‑identification)结果。基于交叉拟合(cross‑fitting)我们提出了天花板估计器,并给出多模态决策改进的精确条件。

为实现有限样本下的诊断,我们引入了两项工具:标签置换乐观下界(label‑permutation optimism floor)和欠拟合曲线(underfit curve)。在三个真实数据集上进行验证:UCI 再入院($n=99{,}343$)、BRFSS 糖尿病($n=253{,}680$)以及 NHANES HbA1c($n=10{,}219$)。结果显示,经过精细调参的梯度提升模型在 UCI 与 BRFSS 数据上几乎逼近估计的天花板,而故意或实际表现不足的学习器仍保留显著差距。NHANES 数据揭示问卷与实验测量的单独边际天花板差异不显著,但二者的联合互补增益显著,否定了“客观模态必然占优”的简化观点。

所有数据集的 AUROC 提升幅度有限,但贝叶斯决策翻转率(Bayes decision‑flip rate)提升显著;不同模型结构往往估计出相似的天花板,却在实际平衡准确率上出现大幅差异。随后,我们依据 PRISMA 方法对 104 项临床任务进行综合,发现跨越 18 类疾病的通道层面规律重复出现:存在一个宽泛但非全局的结构化临床区间、同一通道内的增益随模型族而递减、以及测量通道变换时性能提升。

该框架将饱和现象从经验观察转化为可审计的决策依据:当学习者差距仍存时改进模型,当测量天花板已达时提升数据采集。

点评

原文链接: https://arxiv.org/abs/2609.01909

[h] 返回首页