NeFut Logo NeFut
EN 管理员登录

[AI学术] 更多批评并不等于更好的审稿:EquiReview-R

发布于:2026-09-04 22:00 最后更新:2026-09-05 12:23
#AI #Machine Learning #Open Source

AI审稿人能够生成大量具体批评,但批评越多并不意味着审稿质量更高。审稿可能遗漏关键缺陷,或保留证据不足的指控。这两类错误需要相反的纠正,而生成式系统和整体指标往往混淆了它们。

因此我们将 AI 辅助审稿重新表述为基于证据的结构化关注点集合的细化过程,将遗漏和过度批评视为独立风险。基于此框架,提出 EquiReview‑R。它在局部证据上解决已有关注点,从独立视角和审稿条件化视角搜索可能遗漏的问题,并给出“停止”“继续”或“延后”三种决策。

为了展示驱动该设计的失败模式,我们构建了一个证据关联的轨迹语料库 ReviewTrace。回顾分析表明,几乎所有高召回率审稿中的关注点都缺乏明确的证据判定,而早期的细化机制无法对其进行修正,必须先进行修订再继续搜索。

在一组冻结的未见论文上,EquiReview‑R 满足预设的非劣性标准(主要遗漏),将主要过度批评比例从 15.5% 降至 8.1%,并实现 9.9% 的单侧遗漏上限,同时对 52.4% 的论文直接给出停止决策。计算量匹配的对照、配对实验和消融研究表明,性能提升来源于修订过程,而非额外推理或更短输出。

我们公开了 ReviewTrace 语料库,作为研究审稿修订、分歧与溯源的证据链接资源。

点评

原文链接: https://arxiv.org/abs/2609.03943

[h] 返回首页