在医疗领域,大型语言模型(LLMs)通常通过选择正确的诊断来评估,但仅靠诊断准确性无法反映模型是否恰当地利用了病例证据。
本文提出了一种针对医疗诊断证据使用的行为审计方法。我们将患者信息分解为证据单元,在受控证据子集下对候选诊断进行评分,并挖掘诊断边际中的低阶交互。
由于医疗证据是与诊断相关的,审计将交互发现与失败分配分开:大的或负的交互可能反映合理的差异诊断,而可疑的交互则需要进行稳健性检查和临床审查。
我们在 DDXPlus、CupCase 和 MedCase 数据集上评估了五个开放权重的 LLM。跨数据集来看,忠实支持和差异冲突或取消占据了大多数交互强度,这表明许多证据交互在临床上是合理的,而非失败。
在以 DDXPlus 为重点的盲审样本中,130项丰富的审查案例中,无效或类似捷径的案例主要集中在否定或缺失的发现以及临床局部证据中。
这些结果表明,准确性可能掩盖候选证据使用的失败,促使对医疗 LLM 评估进行角色意识审计。