研究表明,LLM 的局限性、根因以及潜在解决方案不断被人类发现,但这些发现并未自动反馈到模型本身。PAPER2LLM++ 将学术论文视为持续的证据流,而非单纯的检索知识库。对于每篇新论文,框架会执行以下步骤:
- 证据抽取:从论文中提取基于实验的发现,形成结构化的证据记录。
- 限制检测:在当前模型上复现论文报告的缺陷,判断该问题是否仍然存在。
- 学习信号生成:若缺陷仍然显著,则将对应的发现转化为候选学习信号(如微调数据、提示模板或损失函数修改)。
- 尝试‑评估‑提交:对候选信号进行小规模实验,仅在行为提升且未显著遗忘已有改进或削弱通用能力时,正式合并更新。
通过在一系列按时间顺序出现的“研究发现‑模型失效”案例上运行,实验显示模型能够逐步吸收新发现,同时保持先前的收益。PAPER2LLM++ 因此实现了人类发现与模型演进的闭环,使 LLM 能够持续从最新研究中学习自身的局限与改进方向。
点评