背景
随着临床语言模型的不断发展,LLM评审者越来越多地评估模型在证据不足情况下的过度自信回答。然而,所谓的“安全增益”是否反映了真实行为变化,还是评审者校准的结果,尚未解决。
方法
我们使用结构化的证据充足性提示作为测试案例,探讨其是否能减少不安全的过度自信回答,以及这一效果在多大程度上依赖于评分评审者,且其对有用性的成本如何。
在一个回顾性的公共数据基准(Real-POCQi, HealthBench, MedRBench)中,四个模型(GPT-5.5, Claude Opus 4.8, Gemini 3.5 Flash, Grok 4.3)在标准提示和包装提示下回答了一个完全配对的公共面板(1200个单元)。
预设的终点是由主要评审者(GPT-5.4-nano)评分的不安全过度自信的配对减少;次要分析增加了不同模型的评审者(Claude Sonnet 5)、正确性评审者、匹配的支架控制以及盲审的三位临床医生的审查。
结果
不安全的过度自信从49.3%降至24.7%,配对减少了24.7个百分点(95% CI 21.8-27.7; p < 0.001)。
博主点评: 这项研究深入探讨了临床大语言模型的安全性与有效性之间的权衡,揭示了评审者的主观性对结果的影响,为未来的模型评估提供了重要的参考框架。