本研究旨在评估在不同上下文窗口长度下,大语言模型(LLM)生成的文献综述质量,并探讨 AI 在文献综述写作中的辅助作用。我们从 Semantic Scholar 与 arXiv 中抽取研究来源,使用 LLM 生成了 20 篇文献综述,这些综述分别在短上下文窗口(约 2k token)和长上下文窗口(约 8k token)下完成。随后,两位研究者依据 15 项评价维度(包括准确性、完整性、创新性、引用覆盖率等)对生成的综述进行打分与质性分析。
结果显示,AI 生成的文献综述仍需人工监督才能达到学术出版标准。随着上下文窗口的扩大,LLM 能够吸收更广泛的信息并在更长的输入中保持连贯性,但也会加剧内容重复、关键工作遗漏以及倾向于描述性而非综合性论述的问题。
我们认为,AI 生成的综述可作为提供基础概览的工具,但其输出必须经领域专家严格审查与润色。未来工作应探索将其他 LLM 或经过微调的模型引入不同学科,并采用人机混合的工作流,以弥补本研究中识别的局限。
博主点评:本文提供了对上下文窗口影响的系统性实验,提醒研究者在使用 LLM 辅助写作时保持批判性思维,并积极构建人机协同的审稿机制。