NeFut Logo NeFut
EN 管理员登录

[AI学术] Paper Pilot:面向应用科学的可追溯证据的人工参与专家系统

发布于:2026-09-02 22:00 最后更新:2026-09-03 02:56
#AI #Machine Learning #LLM

大型语言模型(LLM)代理正日益嵌入文献分析、稿件起草和审稿等科研工作流。现有系统虽能实现自主发现和稿件生成,却未解决治理难题:在缺乏强制人工批准或制品级可追溯性的 AI 辅助流程中,思想、方法、结果和主张会无控制地传播。\ \ 本文提出 Paper Pilot,一套面向应用科学的人工参与专家系统,实现证据可追溯的稿件生成。系统沿用协同代理推理工程(CARE)方法,将其映射到稿件开发流程,核心包括稿件所有者审批闸口、明确的“不通过”标准、主张分类、审计日志、顾问 LLM 评审以及证据锁定的修订控制。\ \ 框架在从创意到主张的全链路设定八个审批闸口,并区分文献支撑的主张与制品支撑的主张,要求报告的数值和解释必须可追溯到已批准的证据。系统提示已公开,可部署于 ChatGPT、Gemini、Claude 或机构内部 LLM 环境。\ \ 作为首轮实证验证,本文在受控、机械评分的基准上评估了引用追溯层,使用两款商业 LLM、真实 arXiv 论文且不引入 LLM 判官:在无闸口的草稿生成中,模型在引用压力下伪造最高 25% 的文献且未标记证据缺口;而在 Paper Pilot 的证据锁定规则下,同样模型的伪造引用为 0,且将植入的缺口显式呈现为占位符。对结果追溯、修订和对抗鲁棒性的初步结果亦指向相同趋势,完整评估留待后续工作。\ \ Paper Pilot 将 LLM 辅助写作定位为受控的人机决策支持过程,而非全自动作者流水线。\ \ 点评

原文链接: https://arxiv.org/abs/2608.28596

[h] 返回首页