NeFut Logo NeFut
EN 管理员登录

[AI学术] SynPre-FL: 颠覆性合成数据驱动的联邦学习训练框架

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #Open Source

摘要

联邦学习(FL)为隐私保护的临床风险预测提供了一种有前景的解决方案,但其应用受限于数据共享的限制、客户端异质性、类别不平衡以及缺乏现实的电子健康记录(EHR)基准。合成数据生成可以缓解数据稀缺问题,但其与联邦优化的结合尚缺乏系统研究。

我们提出了 SynPre-FL,这是一个统一的框架,将高保真的合成 EHR 生成与合成预训练的 FL 结合起来,以在非独立同分布(non-IID)条件下进行稳健预测。一个潜在的自编码器-扩散模型生成隐私保护的合成群体,这些数据用于热启动联邦训练。预训练之后,采用考虑异质性的优化方法,使用类别平衡的局部目标、近端正则化和自适应服务器聚合。

后期校准和联邦安全可解释性支持可靠且可解释的风险评估。实验表明,合成生成器在保护成员推断和重建攻击的同时,保留了单变量、双变量和多变量的结构。生成的数据在 TSTR、TRTS 和基于模型的评估中展现出强大的下游效用。在 5、10 和 15 个异质客户端的联邦设置中,SynPre-FL 在严重的非 IID 碎片化条件下,始终改善了稳健性和可扩展性,优于基线方法。校准提高了概率的可靠性,而 SHAP 分析在不同的联邦规模上产生了稳定且临床一致的特征归因。

因此,SynPre-FL 提供了一个实用且可重复的框架,将合成数据与 FL 结合,以实现基于分布的表格 EHR 数据的隐私意识、可解释性和稳健的临床预测。

博主点评: SynPre-FL 的提出为联邦学习在医疗领域的应用开辟了新方向,通过合成数据的生成与优化,解决了数据隐私和不平衡问题,具有重要的实际意义。该框架的可重复性和稳健性使其在临床预测中展现出广泛的应用潜力。

原文链接: https://arxiv.org/abs/2607.19524

[h] 返回首页