摘要
临床编码预测将非结构化的出院摘要映射到 ICD-10-CM 叶码,涉及一个大型、稀疏且深层次的标签空间。大多数系统将该任务视为平面的多标签分类,独立评分代码,且对稀有标签提供有限的训练信号。我们提出了一种图约束的遍历策略,将 ICD 预测构建为在剪枝代码层次结构上的有限时域决策过程。单个语言模型逐层下降图,选择有效的子节点,直到到达可计费的叶码。这将极端多标签预测转化为稀疏、具层次感的子集决策,同时确保结构上有效的输出。
在 MIMIC-IV 出院摘要中,我们的最佳监督策略 SFT-1+ 在经过筛选的 50 个代码子集上达到了 0.709 的微 F1 值,而在完整的 15,761 代码空间中则为 0.527,超越了包括 CAML、LAAT 和 PLM-ICD 在内的平面基线。在完整设置中,SFT-1+ 比最强的平面基线提高了 0.044 微 F1 和 0.157 宏 F1,表明图约束分解缓解了稀有代码瓶颈。通过控制的因子研究评估了架构、训练算法和数据预算。在两个规模上,共享政策匹配了三个专家级级联,同时避免了在 28-32% 全空间测试记录上的上下文窗口溢出。增加监督轨迹数据是唯一持续改善性能的干预措施,而 GRPO 强化学习在与匹配数据的监督延续下未能提供任何益处。这些结果表明,简单的图约束策略学习可以超越更复杂的平面、级联和强化学习替代方案,适用于极端临床编码预测。
博主点评: 该研究通过引入图约束策略,成功解决了临床编码预测中的稀有标签问题。其创新性在于将复杂的多标签任务分解为可管理的子集决策,显著提高了模型的预测性能。这为相关领域提供了新的思路,尤其是在处理高维标签空间时。