在医学多选题回答(MCQA)中,检索增强生成(RAG)技术可以补充语言模型(LM)的领域知识。然而,传统的 RAG 由于不加区分地利用检索到的文档,可能会降低语言模型的性能。为了解决这个问题,我们提出了 MedJudgeRAG 框架。该框架将检索到的文档表示为一个动态知识图谱(KG),由实体和关系组成。
对于每个选项,模型从检索到的文档和知识图谱中判断证据的有效性。基于这些有效性判断的组合,模型决定一种知识利用策略,以推理出最终答案。这些能力通过监督微调进行训练,使用由教师语言模型生成的结构化推理痕迹。训练过程中采用加权交叉熵损失,差异性地权重知识图谱和推理段落。
在两个医学 MCQA 基准测试上的实验结果表明,MedJudgeRAG 始终优于传统 RAG 和参数基线。此外,消融分析表明,动态知识图谱在训练时作为图条件监督的效果优于在推理时作为显式输出的效果。我们的代码可在 GitHub 上获取,生成的推理痕迹可在 Hugging Face 上下载。
博主点评: MedJudgeRAG 的提出标志着医学多选题回答领域的重要进展。通过将知识图谱与语言模型结合,这一方法不仅提升了模型的推理能力,还为医药领域的智能问答系统提供了新的思路。动态知识图谱的应用进一步增强了模型在复杂情境下的表现,值得后续研究深入探索。