AI审稿人能够生成大量具体批评,但批评越多并不意味着审稿质量更高。审稿可能遗漏关键缺陷,或保留证据不足的指控。这两类错误需要相反的纠正,而生成式系统和整体指标往往混淆了它们。
因此我们将 AI 辅助审稿重新表述为基于证据的结构化关注点集合的细化过程,将遗漏和过度批评视为独立风险。基于此框架,提出 EquiReview‑R。它在局部证据上解决已有关注点,从独立视角和审稿条件化视角搜索可能遗漏的问题,并给出“停止”“继续”或“延后”三种决策。
为了展示驱动该设计的失败模式,我们构建了一个证据关联的轨迹语料库 ReviewTrace。回顾分析表明,几乎所有高召回率审稿中的关注点都缺乏明确的证据判定,而早期的细化机制无法对其进行修正,必须先进行修订再继续搜索。
在一组冻结的未见论文上,EquiReview‑R 满足预设的非劣性标准(主要遗漏),将主要过度批评比例从 15.5% 降至 8.1%,并实现 9.9% 的单侧遗漏上限,同时对 52.4% 的论文直接给出停止决策。计算量匹配的对照、配对实验和消融研究表明,性能提升来源于修订过程,而非额外推理或更短输出。
我们公开了 ReviewTrace 语料库,作为研究审稿修订、分歧与溯源的证据链接资源。
点评