NeFut Logo NeFut
EN 管理员登录

[AI学术] 前沿大语言模型在指南符合和特定病例肿瘤决策中的能力边界

发布于:2026-09-02 22:00 最后更新:2026-09-03 02:56
#AI #Machine Learning #LLM

我们构建了肿瘤决策边界基准(Oncology Decision Boundary Benchmark,ODBB),收录了 2,005 条基于 NCCN 指南的肿瘤决策点以及结直肠癌病例。针对 2025 年 6 月至 2026 年 4 月间发布的九种前沿大语言模型(四个闭源、五个开源权重系列)进行评估。采用全确定性评分器(无需模型推理)将模型输出划分为 14 种失败类型,并在 225 条分层抽样样本上由两位肿瘤科医生独立验证,Cohen 加权 κ 分别为 0.939 和 0.790。将九个模型视为一个超模型,发现 42.1%(Wilson 95% CI 40.0–44.3%)的全部项目——其中 NCCN 项目 35.7%、结直肠癌病例 66.4%——没有被任何模型正确回答。错误主要集中在选择指南路径的阶段,而不是在路径内部的推理,表明临床元判断存在一致性盲点,可能需要架构层面的干预而非更多训练数据。两款针对决断性调优的模型(GPT‑5.5、Gemini 3.1 Pro Preview)出现不安全承诺的频率是七款保守模型的三到五倍,但并未获得更高得分。约 3–9% 的项目中,模型能够给出正确的下一步临床措施,却未作出明确承诺——这属于决策失误而非知识缺失。结论是,模型质量已不再是临床 LLM 部署的主要瓶颈,关键约束在于单一模型能否承担全部临床决策。未来需要能够检测模型能力边界并将超出范围的决策转交给临床医生的系统架构。

点评

原文链接: https://arxiv.org/abs/2608.28592

[h] 返回首页