NeFut Logo NeFut
EN 管理员登录

[AI学术] 面向科学影响的创意生成方法

发布于:2026-09-26 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

科学创意的产生正日益依赖大语言模型(LLM),但现有系统大多在新颖性、清晰度和可行性等即时可评估的指标上进行训练和评估。这导致我们无法确认是否可以利用延迟出现的学术采纳信号来引导模型朝向更具\emph{影响力}的研究方向。我们使用归一化引用次数作为一种噪声较大但可扩展的学术采纳代理,探讨这一可能性。我们从超过10万篇计算机科学论文中抽取目标条件化的创意描述,并为每篇论文分配一个基于年份的序数化引用标签。随后,构建一个目标条件化奖励模型,用于预测研究目标与创意对的引用标签,并将该奖励用于通过监督微调和强化学习(RL)对创意生成器进行对齐。为避免循环依赖,我们采用持出参考基准的评估方案:在相同研究目标下,将模型生成的创意与历史创意进行比较,并依据参考创意的引用标签对判断进行加权。实验表明,经过RL微调的模型在估计影响力上始终优于基线模型和仅监督微调的模型。我们的工作表明,科学影响可以作为一种实际、结果导向的反馈信号,用于在开放式科学发现中对齐LLM。

点评

原文链接: https://arxiv.org/abs/2609.29802

[h] 返回首页