NeFut Logo NeFut
EN 管理员登录

[AI学术] 合成医疗图像助力消除偏见与检测疾病分类器的公平性

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#AI #Machine Learning #Open Source

摘要

在医学图像分类器的子群体公平性审计中,面临样本量问题:在保留的测试集中的少数子群体样本过少,导致每个子群体性能的置信区间宽于审计所要检测的偏见。我们认为,基于人口统计的合成生成器可以同时实现:缓解训练阶段的偏见和检测评估阶段的偏见。我们在COVID-19胸部CT分类中运用了端到端微调的Stable Diffusion 2.1生成器,并得出了两项发现。

在偏见缓解(训练)方面,人口统计平衡的合成群体作为预训练先验最为有效,而非联合增强:在相同固定数据的条件下,顺序预训练后微调显著优于联合增强,最终的分类器在大约100倍的真实数据效率下超越了全真实基线。

在偏见检测(评估)方面,跨越五个合成少数群体和五个分类器种子,合成估计器重现了一个强大的真实oracle的子群体排名(Spearman \rho = 1.00在MCC和召回率上),并在真实测试集样本耗尽时提供了更可靠的每个单元估计。因此,合成群体在公平性审计关注的单元中最为有用,既是修复子群体偏见的工具,也是测量其偏见的手段。

博主点评: 本文展示了合成数据在医疗图像分类中的潜力,特别是在处理少数群体样本不足问题上。通过优化训练与评估流程,显著提高了分类器的效能,同时也为公平性审计提供了新工具,值得进一步探索其在其他领域的应用。

原文链接: https://arxiv.org/abs/2607.14984

[h] 返回首页