大型语言模型(LLM)在医学知识考试中取得高分,但真实的肿瘤学临床并非单纯的知识测验,而是涉及指南路径选择、升级判断以及在不确定性下的承诺序列。现有基准主要衡量事实回忆,未能揭示前沿 LLM 是否存在共同的决策盲点。
我们构建了肿瘤决策边界基准(Oncology Decision Boundary Benchmark,ODBB),收录 2,005 条基于 NCCN 指南的肿瘤决策点以及结直肠癌病例。对九个前沿 LLM(四个闭源、五个开源权重系列,发布时间 2025 年 6 月至 2026 年 4 月)进行评估。采用全确定性评分器(零 LLM 推理),将模型输出划分为 14 种失败类型,并在 225 项分层抽样上由两位肿瘤科医生独立验证,Cohen 加权 $\kappa$ 分别为 0.939 和 0.790。
将九个模型视为一个超模型,发现 $42.1%$(Wilson 95% CI 40.0--44.3%)的所有项目无人正确回答,其中 NCCN 项目为 $35.7%$,结直肠癌病例为 $66.4%$。错误主要集中在选择指南路径阶段,而非在路径内部推理,表明临床元判断存在一致盲点,可能需要架构层面的干预而非单纯增加训练数据。
两款被调教为更具决断性的模型(GPT-5.5、Gemini 3.1 Pro Preview)出现不安全承诺的频率是其余七款谨慎模型的三到五倍,却未能提升整体得分。约 $3%$–$9%$ 的项目中,模型能够给出正确的下一步,但未作出明确承诺,这属于决策失误而非知识缺失。
结论是,模型质量已不再是临床 LLM 部署的主要瓶颈,关键约束在于假设单一模型能够承担全部临床决策。未来需要能够检测模型能力边界并在超出范围时将决策转交给临床医生的系统架构。
博主点评:该研究揭示了即使是最先进的 LLM,也在临床元判断上存在系统性盲点,提示我们在追求更高准确率的同时,更应关注模型的自我边界感知与安全交互机制。