NeFut Logo NeFut
EN 管理员登录

[AI学术] MedLoCoMo:大型语言模型的长期多会话医学对话基准测试

发布于:2026-07-28 22:00 最后更新:2026-07-29 01:08
#AI #Medical #Benchmark

MedLoCoMo是一个医学长期上下文记忆基准,旨在针对多次入院的患者进行临床推理。现有的医学QA基准大多测试短上下文知识或单一文档的关联,尚不清楚大型语言模型(LLMs)能否有效利用、关联和推断长期的患者历史信息。

我们从去标识化的MIMIC-IV和MIMIC-IV-Note记录中构建了MedLoCoMo,通过构建入院级临床数据包、合成基于证据的医生-患者对话,并生成与QA项目关联的证据,涵盖单次入院、跨入院及对抗性不可回答情境。该基准包含100个患者时间线,平均每个对话有1,669.8个回合、29.7个会话和74,512.2个标记。

在评估的基线模型中,跨入院推理的难度始终高于局部证据的使用,即便模型具有较长的上下文窗口或使用外部记忆或检索方法。代码和MedLoCoMo基准的发布可在 GitHub 上获取,以便使用和复现。

博主点评: MedLoCoMo基准的推出填补了医学对话领域的空白,尤其是在处理长期患者历史时的复杂性。这一创新为LLMs在临床推理中的应用提供了新的挑战与机遇,值得研究者深入探索其潜力。

原文链接: https://arxiv.org/abs/2607.22566

[h] 返回首页