NeFut Logo NeFut
EN 管理员登录

[AI学术] 超越最终决定:面向过程的透明 AI 辅助同行评审基准

发布于:2026-09-10 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #Open Source

Peer review 是科学质量控制的核心。现有对 AI 辅助审稿的评估主要关注生成审稿的整体质量或最终决定的准确性,缺乏对模型决策是否基于充分可靠证据的检验。我们提出一个面向过程的诊断基准,用 (x,$z_s$,$z_c$,$z_r$,y) 表示论文内容、摘要、批评、建议和决定。我们将 PeerRead、NLPeer ARR-22、OpenReview-ICLR 的异构审稿记录转换为过程对齐的数据。基准以直接从论文内容预测决定(Direct)为基线,比较 Gold‑process 变量和 Predicted‑process 变量的决定价值,并进行阶段级评估、链一致性评估和干预敏感性分析。实验在三套数据和六种模型上显示,Gold‑process 变量的决定价值普遍更高。对主分析模型而言,Gold‑Predicted 差距在不同数据集和随机种子下保持稳定,并在多数模型‑数据集组合中复现。虽然模型生成的中间审稿文本在相邻阶段之间局部一致性较高,但最终决定并未始终得到前置审稿证据的支持。我们的基准面向帮助而非取代人工审稿的 AI 系统,提供透明可审计的诊断工具以评估其审稿过程的可靠性。

点评

原文链接: https://arxiv.org/abs/2609.05947

[h] 返回首页