大型语言模型(LLM)代理正日益渗透到文献分析、草稿撰写和审稿等科研工作流中。现有系统虽能实现自动化发现和稿件生成,却未能解决治理难题:在缺乏强制性人工批准和工件级可追溯性的情况下,思想、方法、结果和主张会在 AI 辅助的流程中自由传播。
本文提出 Paper Pilot,一种面向应用科学的人工‑在‑回路专家系统,旨在实现证据可追溯的稿件生成。系统基于 Collaborative Agent Reasoning Engineering(CARE)方法论,对稿件开发引入稿件所有者批准门、明确的“不通过”标准、主张分类、审计日志、顾问 LLM 评审以及证据锁定的修订控制。
Paper Pilot 在从想法到主张的全链路上设定了八个批准门,区分文献支撑的主张和工件支撑的主张,要求所有报告的数值和解释必须可追溯到已批准的证据。系统提示(system prompt)已公开,可在 ChatGPT、Gemini、Claude 或机构内部 LLM 环境中部署。
为验证框架的有效性,本文对引用支撑层进行了一项受控基准测试:使用两款商业 LLM、真实 arXiv 论文、且不依赖 LLM 评审者的机械评分。结果显示,在没有门控的草稿生成中,模型在引用上最高出现 25% 的捏造且未检测到证据缺口;而在 Paper Pilot 的证据锁定规则下,捏造引用为零,所有植入的缺口均被显式标记为占位符。对结果支撑、修订过程和对抗鲁棒性的初步实验亦呈现相同趋势,完整评估留待后续工作。
Paper Pilot 将 LLM 辅助写作定位为受控的人机决策支持过程,而非完全自主的作者流水线。
博主点评:Paper Pilot 在技术上通过明确的审批门和审计机制,为 AI 生成科研内容提供了可追溯的治理框架,解决了当前 AI 写作的可信度危机。后续若能在更大规模的真实科研项目中验证其可用性,将有望成为学术出版的标准工具。