NeFut Logo NeFut
EN 管理员登录

[AI学术] LLM 能否遵循医学专家逻辑?风险偏倚评估的层次逻辑一致性基准

发布于:2026-09-12 22:00 最后更新:2026-09-15 01:15
#AI #Machine Learning #LLM

证据医学要求严格的逻辑一致性,但现有对大语言模型(LLM)的评估往往只看标签匹配,忽视真实推理。为此我们构建了 LogiMed‑RoB 基准,基于 Cochrane 风险偏倚(RoB)2.0 的专家逻辑,收录 860 例随机对照试验(RCT)和 14,820 条查询。

LogiMed‑RoB 采用层次逻辑一致性(Hierarchical Logical Consistency, HLC)框架,分别测量四个维度:原子一致性(Atomic Consistency)、领域一致性(Domain Consistency)、聚合一致性(Aggregation Consistency)以及证据忠实度(Evidential Faithfulness)。

在 10 种主流 LLM 上的实验揭示了 错误叠加效应:最高模型的原子一致性可达 98.88%,但端到端一致性骤降至 45.13%;若干开源模型甚至接近 0%。进一步分析发现 证据‑推理鸿沟:即使模型检索到高质量证据,仍有 18.63%‑40.05% 的情况推导出错误结论,盲猜率高达 48.28%。

这些结果表明,仅凭结果准确率难以发现关键的推理缺陷,临床部署必须加入白盒式的逻辑验证。

点评

原文链接: https://arxiv.org/abs/2609.11185

[h] 返回首页