Hantavirus 基因组监测受限于序列数据的分布、非独立同分布源的异质性以及专家审查能力的限制。我们提出了 HantaWatch,这是一种联邦学习框架,允许实验室和监测站点在不共享原始数据的情况下协作训练基于序列的模型。
HantaWatch 集成了以下几个核心组件:
- k-mer 特征提取:从序列数据中提取重要特征以进行模型训练。
- 源感知的联邦客户端构建:根据数据源的特性构建有效的客户端。
- 自适应 DU-FedProx 优化:采用先进的优化算法来提高模型的收敛速度和稳定性。
- 监测特定的模型选择:根据任务需求选择适当的模型。
- 仅预测的分流:实现快速的决策支持。
在二元和多类任务上的实验表明,HantaWatch 支持高风险筛查、疫情相关预测、谱系分类和临床综合征分类,同时平衡预测性能、假阴性风险和更新稳定性。该框架将模型输出转换为风险评分、置信度估计、不确定性标志和专家审查优先级排序,从而为去中心化的汉坦病毒监测提供了实用的联邦决策支持层,支持专家优先级排序,而不取代实验室或公共卫生的解释。
博主点评: HantaWatch 的创新在于其联邦学习的应用,能够在保护数据隐私的同时,提升汉坦病毒监测的效率和准确性。这一框架的设计充分考虑了不同数据源的异质性,为公共卫生领域的实时决策提供了强有力的支持。其未来的应用潜力值得关注。