NeFut Logo NeFut
EN 管理员登录

[AI学术] NovGauge:细粒度大语言模型新颖性评估基准

发布于:2026-09-12 22:00 最后更新:2026-09-15 01:15
#AI #Machine Learning #LLM

NovGauge 是一个面向大语言模型(LLM)新颖性评估的细粒度基准。数据来源于 ICLR 评审重叠声明和调查共引,两类专家标注共计 619 对论文以及 50 组多篇论文。每条实例独立标注任务、问题、方法三个维度,分别对应应用目标、技术挑战和解决方案。我们设计了级联诊断流水线,先检查维度预测是否正确,再验证证据是否落地,最后判断逻辑支撑是否成立。对 18 种 LLM 的评测显示,幻觉率在不同维度间从 0% 到 39% 不等;在非幻觉的正确正例中,超过 70% 的引用证据未能逻辑支撑给出的理由。表现最好的模型 GPT-5.5 在三个维度上实现了 43%~72% 的 Verified F1,而大多数模型在可信度校验后原始 F1 下降至不足一半。结果表明,当前 LLM 在科学新颖性评估上仍不可靠,尤其是当正确性依赖于可信证据时。

点评

原文链接: https://arxiv.org/abs/2609.11234

[h] 返回首页