NeFut Logo NeFut
EN 管理员登录

[AI学术] 大型语言模型在患者证据演变时表现出不可靠的临床判断更新

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

大型语言模型(LLM)正被用于临床推理,但其在患者证据随时间变化时是否能正确修正判断尚不明确。我们利用电子健康记录中的重症监护患者轨迹,构建了匹配的纵向信念更新实验。

在多种LLM上,若在预测时加入前一次判断,模型的预测误差更可能增加而非减少,这一现象在另一个结局指标上也得到了复现。通过受控干预我们发现两类失效模式。

第一类:在前一次评估固定的情况下,模型对呼吸恶化的证据响应更强,而对同等程度的改善响应较弱;即使在中等和强证据水平进行头部空间归一化,这种不对称仍然存在。

第二类:在当前证据固定的情况下,将先验风险从10%提升至90%会使模型估计改变约26.2个百分点,说明先验信念对输出有因果影响。使用提示词(prompt)并未恢复可靠的更新行为。

我们提出的Evidence‑Validated Longitudinal Update(EVLU)方法能够筛选出更少但更可靠的修正,展示了可靠性与覆盖率之间的权衡。上述结果表明,纵向信念更新应被视为评估LLM可靠性的独立维度。

点评

原文链接: https://arxiv.org/abs/2610.02684

[h] 返回首页