NeFut Logo NeFut
EN 管理员登录

[AI学术] 揭示心理健康领域大语言模型的局限性:Safe-Psych基准测试

发布于:2026-07-16 22:00 最后更新:2026-07-17 08:45
#algorithm #AI #Machine Learning

在医疗保健中,大语言模型(LLMs)越来越被用于决策支持,但临床证据往往不完整或在不断演变。当可用信息不足以支持可靠答案时,模型应请求澄清或选择不回答,而不是提供不支持的回应。现有的医学基准通常假设可以提前获得完整信息。

我们引入了 Safe-Psych,这是一个用于评估 LLM 如何处理临床精神病学中不断演变的诊断不确定性的序列基准。Safe-Psych 包含超过 1,000 份真实的精神病临床记录,分段以模拟增量证据披露,并在每个阶段提供精神科医生衍生的行动标签:DIAGNOSE、CLARIFY 或 ABSTAIN。

我们在完整信息和序列设置下评估了多种最先进的 LLM。我们的研究发现,能力并不意味着校准:即使是强大的模型在不完整的临床信息下也面临挑战,大多数模型的低拒绝率超过 60%,而关注安全的提示仅通过将错误转向过度拒绝来减少过早承诺。

在序列评估中,模型通常在证据不足时就进行诊断,除非明确提示,否则很少寻求澄清;这些过早的诊断比及时的诊断准确性更低。

总体而言,Safe-Psych 揭示了被评估模型的一个局限性:识别临床证据不完整并需要额外信息的能力。我们发布 Safe-Psych 以支持提高 LLM 在医疗保健中安全性的研究。

博主点评: Safe-Psych 的推出为大语言模型在精神健康领域的应用提供了重要的评估标准,揭示了模型在应对不确定性时的缺陷。这一研究强调了在医疗决策中,模型不仅需要处理信息,还需识别信息的完整性,未来在模型设计中需更关注这一关键点。

原文链接: https://arxiv.org/abs/2607.13036

[h] 返回首页