NeFut Logo NeFut
EN 管理员登录

[AI学术] 超越模仿审稿人:评估 LLM 在提交前同行评审中的作用

发布于:2026-09-10 22:00 最后更新:2026-09-12 06:35
#Machine Learning #LLM #Artificial Intelligence

同行评审的反馈往往在作者完成修改后才到达,导致改动价值受限。本文研究了一种面向作者的 LLM 系统,它在论文提交前生成大量原子化的潜在问题,并将这些问题压缩成一份简短报告。我们使用 10,000 篇 ICLR 2026 投稿,其中 3,398 篇在评审前已有可获取的预印本,进行实验评估。

在一次十篇论文的诊断实验中,独立抽样能够覆盖历史问题的 44.9%;经过去重和补全后,严格覆盖率提升至 78.7%,按严重程度加权后达到 84.9%。实现这些覆盖率需要 3.6\times 请求量和 5.2\times token 量的增长。

一个隐藏的 Top-32 Oracle 在 256 候选池中保持了 79.3% 的加权覆盖率,而仅基于论文特征的选择器只能达到 40%~44%。因此,LLM 评审在大候选池下能够提供广泛覆盖,但在压缩阶段表现不佳。消融实验表明,代表性选择策略和匹配器的敏感度是导致压缩效率下降的主要因素。

点评:该工作展示了 LLM 在提前捕获审稿关注点方面的潜力,尤其在大规模候选生成时能够实现高覆盖。但要实现实用的简报压缩,还需在候选筛选和匹配精度上进一步优化。

原文链接: https://arxiv.org/abs/2609.05788

[h] 返回首页