Automated reviewing 系统正被用于衡量评审质量,但只有在作者根据评审改进论文时才有意义。我们提出 AppliedScientist,一个闭环系统,将自主 AI 科学家与 AI 评审者耦合,并通过对多个子领域被拒稿的反复修订进行评估。
在修订过程中,AI 科学家可以访问自身的历史版本,以模拟人类作者基于前稿的改进;评审者则独立生成评审,且不记得之前的反馈或分数,从而避免偏见。
我们比较了三种修订设置:使用原始会议评审初始化、使用 AI 生成评审初始化,以及在每轮使用相同固定提示的全自助修订。为了验证评审者的引导效果,还使用 Stanford Reviewer 作为独立评估器对人类初始化的修订进行打分。
实验表明,评审者引导的修订始终优于固定提示的自我修订,且 Stanford Reviewer 对后期修订给出更高分数。AppliedScientist 解决了 128/150(85.3%)的实验实现缺陷,但仅解决了 2/18(11.1%)的创新性问题,说明迭代修订能显著提升实验与实现层面,却难以改变对新颖性或意义的担忧。
该工作展示了闭环 AI 评审‑修订流程的潜力,为未来自动化科研提供了可行路径。
点评