大型语言模型(LLM)正被用于临床推理,但其在患者证据随时间变化时是否能正确修正判断尚不明确。我们利用电子健康记录中的重症监护患者轨迹,构建了匹配的纵向信念更新实验。
在多种LLM上,若在预测时加入前一次判断,模型的预测误差更可能增加而非减少,这一现象在另一个结局指标上也得到了复现。通过受控干预我们发现两类失效模式。
第一类:在前一次评估固定的情况下,模型对呼吸恶化的证据响应更强,而对同等程度的改善响应较弱;即使在中等和强证据水平进行头部空间归一化,这种不对称仍然存在。
第二类:在当前证据固定的情况下,将先验风险从10%提升至90%会使模型估计改变约26.2个百分点,说明先验信念对输出有因果影响。使用提示词(prompt)并未恢复可靠的更新行为。
我们提出的Evidence‑Validated Longitudinal Update(EVLU)方法能够筛选出更少但更可靠的修正,展示了可靠性与覆盖率之间的权衡。上述结果表明,纵向信念更新应被视为评估LLM可靠性的独立维度。
点评