NeFut Logo NeFut
EN 管理员登录

[AI学术] 感知与敏感性:使用医生专家对LLM临床分诊建议进行基准测试

发布于:2026-10-01 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

随着大语言模型(LLM)在临床环境中的使用日益增多,评估其在真实文本变异下的可靠性变得至关重要。本文聚焦临床分诊任务,将LLM的推荐与执业医师在保持临床情境不变的文本扰动下进行比较。我们构建了一个基准,包括超过6000个临床场景、7000条医师标注以及225000条模型响应。实验得到两点主要结论:其一,在原始输入下,LLM比医师更倾向于推荐不必要的检查或治疗,并且在文本被扰动后这种倾向进一步加剧;其二,LLM的推荐对性别和语气的扰动更为敏感,而医师的建议相对稳健。这表明LLM会因临床无关的文字变化而产生不同的决策,强调在实际部署前必须基于专家医师行为进行面向应用的评估。点评

原文链接: https://arxiv.org/abs/2609.38600

[h] 返回首页