NeFut Logo NeFut
EN 管理员登录

[AI学术] HalluPeer:面向科学同行评审的幻觉检测基准

发布于:2026-09-04 22:00 最后更新:2026-09-05 12:23
#AI #Machine Learning #LLM

随着学术同行评审规模的扩大,研究者开始尝试使用大语言模型(LLM)辅助审稿。然而,LLM 能生成流畅却缺乏依据的陈述,削弱了评审的可信度。现有的幻觉检测基准并未针对同行评审设计,因为评审需要在长篇技术论文中寻找依据。

我们推出 HalluPeer,提供论文内容、人工撰写的评审以及注入幻觉的评审三元组,并对每条记录进行检测、分类和定位标注。构建流程包括:依据同行评审场景诱导幻觉分类体系、识别评审中的上下文位置、利用自动过滤将幻觉注入文本。

在 12K 篇论文和 38K 条评审上进行实验,结果显示现有检测器难以区分幻觉与合理批评。进一步在真实评审上验证,发现 HalluPeer 定义的幻觉模式确实存在,凸显了基于来源的验证需求。项目代码与数据已公开于 https://github.com/Lin-TzuLing/HalluPeer.git

点评

原文链接: https://arxiv.org/abs/2609.03580

[h] 返回首页