随着大语言模型(LLM)在临床环境中的使用日益增多,评估其在真实文本变异下的可靠性变得至关重要。本文聚焦临床分诊任务,将LLM的推荐与执业医师在保持临床情境不变的文本扰动下进行比较。我们构建了一个基准,包括超过6000个临床场景、7000条医师标注以及225000条模型响应。实验得到两点主要结论:其一,在原始输入下,LLM比医师更倾向于推荐不必要的检查或治疗,并且在文本被扰动后这种倾向进一步加剧;其二,LLM的推荐对性别和语气的扰动更为敏感,而医师的建议相对稳健。这表明LLM会因临床无关的文字变化而产生不同的决策,强调在实际部署前必须基于专家医师行为进行面向应用的评估。点评