AI 生成的内容(常称为 AI 废话)在学术界日益普遍。与普通文本不同,AI 生成的科学论文往往在结构上看似合理,却在连接各部分的科学推理上出现断层,容易误导读者。我们将这种失误定义为 科学废话,并通过结构、论证和实验产出三个维度设计了六项度量指标。
基于这些指标,我们构建了 SciSlopBench,收录 390 篇 AI 生成的论文,主要是计算机科学,也覆盖生命、社会和自然科学。每篇 AI 论文都与一篇在研究问题和贡献类型上匹配的人类论文配对。实验表明,使用六项指标能够以 85.9% 的准确率识别出 AI 论文,而现有的 Binoculars 检测器仅为 68.7%。此外,科学废话程度与 ICLR 评分呈负相关,并能在 2017‑2025 年的所有年份中以高于随机的概率区分被接受和被拒稿。
直接对指标进行优化并不能有效降低废话。为此我们提出 SciSlopHarness——一种在固定 LLM 上运行的框架,仅在实验记录支持的地方对论文进行修正。普通的文本润色仍会留下残余废话,而基于废话感知的提示则会导致奖励黑客。SciSlopHarness 在不依赖人工参考的前提下,将 AI‑人类差距缩小了 63%,显著优于最强的修订基线。
总体而言,AI 生成的科学论文在全局推理层面留下了可检测的痕迹,负责任的缓解措施需要严格的证据支撑,而非仅仅改善文字表述。
点评