在医疗保健中,大语言模型(LLMs)越来越被用于决策支持,但临床证据往往不完整或在不断演变。当可用信息不足以支持可靠答案时,模型应请求澄清或选择不回答,而不是提供不支持的回应。现有的医学基准通常假设可以提前获得完整信息。
我们引入了 Safe-Psych,这是一个用于评估 LLM 如何处理临床精神病学中不断演变的诊断不确定性的序列基准。Safe-Psych 包含超过 1,000 份真实的精神病临床记录,分段以模拟增量证据披露,并在每个阶段提供精神科医生衍生的行动标签:DIAGNOSE、CLARIFY 或 ABSTAIN。
我们在完整信息和序列设置下评估了多种最先进的 LLM。我们的研究发现,能力并不意味着校准:即使是强大的模型在不完整的临床信息下也面临挑战,大多数模型的低拒绝率超过 60%,而关注安全的提示仅通过将错误转向过度拒绝来减少过早承诺。
在序列评估中,模型通常在证据不足时就进行诊断,除非明确提示,否则很少寻求澄清;这些过早的诊断比及时的诊断准确性更低。
总体而言,Safe-Psych 揭示了被评估模型的一个局限性:识别临床证据不完整并需要额外信息的能力。我们发布 Safe-Psych 以支持提高 LLM 在医疗保健中安全性的研究。
博主点评: Safe-Psych 的推出为大语言模型在精神健康领域的应用提供了重要的评估标准,揭示了模型在应对不确定性时的缺陷。这一研究强调了在医疗决策中,模型不仅需要处理信息,还需识别信息的完整性,未来在模型设计中需更关注这一关键点。