NeFut Logo NeFut
EN 管理员登录

[AI学术] 基于GAVEL的临床时间线对比与校正

发布于:2026-09-15 22:00 最后更新:2026-09-16 00:22
#Machine Learning #LLM #Artificial Intelligence

我们提出了 GAVEL(Grounded Adjudication of Variations across Extracted TimeLines),一种基于大语言模型(LLM)的评审协议,用于将两条从病例报告中抽取的临床时间线与原始报告进行逐条比对。GAVEL 为每个差异输出三类信息:差异类型、裁决结果以及对应的报告片段,从而实现对抽取结果的细粒度审查。\ \ 在实验中,我们首先评估了事件匹配器的准确性,随后审阅了来自 GPT‑5.6sol 与 DeepSeek V3.2 的 2,738 条比对结果。基于这些结果,我们对六种 LLM 抽取器和两位人工标注员进行了排名,并进一步测试了基于 GAVEL 的时间线合并策略。\ \ 结果显示,匹配率在 0.10 阈值以下为 60%,在阈值以上为 48%。人工复核确认了 89.4% 与 88.6% 的差异判定。对 126 份病例报告进行合并后,77.0% 的比较中合并后的时间线更受偏好(95% CI: 69.8%–84.1%),且每份报告的差异数从 7.63 降至 0.85。\ \ GAVEL 的核心优势在于不把任一时间线视为绝对真值,而是通过报告文本直接进行对比与修正,为临床时间线抽取提供了更可靠的评估与迭代手段。\ \ 点评

原文链接: https://arxiv.org/abs/2609.13475

[h] 返回首页