本文评估了七种大型语言模型(LLM)在 TAME 疼痛语音语料库上的表现。受试者朗读音素平衡的 Harvard Sentences,同时将一只手浸入冷水或温水,并仅在出现疼痛陈述时报告疼痛。实验产生了 5,750 条无疼痛信号的句子(转录中不含疼痛词汇)和 1,294 条包含明确疼痛评分的句子。
在无信号条件下,疼痛可通过声学特征恢复(AUC = 0.622,95\% CI 为 0.553~0.662),而仅基于转录的预测几乎是随机的(AUC = 0.489,95\% CI 为 0.418~0.504)。由于自动语音识别(ASR)去除了声学疼痛线索,任何仅凭转录推断的疼痛评分都缺乏证据支持。
在合作式提示下,六个模型几乎对所有无信号转录都选择弃答,并在正向对照任务中以 0.939~1.00 的准确率正确提取口头疼痛评分,期望校准误差不超过 0.100。
在权威式提示下,弃答率高度依赖提示措辞,同一模型在不同提示下的弃答率从 0.18 到 1.00 不等。强制回答时,大多数模型给出低置信度估计,但 Gemini 2.5 Flash 与 Llama 3.1 8B 持续生成高置信度疼痛评分,其自信捏造率分别为 0.53 与 0.76,远高于其他模型的最高 0.15。
强制回答的结果未显示显著的人口统计学差异,所有 $p$ 值均 $\geq 0.20$。
博主点评:该研究通过精心设计的实验区分了模型的合理弃答与无依据的自信捏造,揭示了提示方式对模型行为的巨大影响。结果提醒我们在高风险医学场景中使用 LLM 时,必须结合声学信息并审慎设计提示,以防止误导性高置信度输出。