NeFut Logo NeFut
EN 管理员登录

[AI学术] 强化学习后训练下语言模型的组合推理研究

发布于:2026-09-18 22:00 最后更新:2026-09-20 12:54
#Machine Learning #LLM #Artificial Intelligence

组合推理是现实问题求解的关键:训练数据有限,模型必须通过新组合已学技能来实现泛化。强化学习等后训练方法显著提升了语言模型的推理能力,但其对组合推理的影响尚不清晰。我们提出一种依赖图框架来形式化组合推理,定义了三层递进的组合性。实验上,我们在数据结构任务上实现该框架,这类任务拥有确定的奖励计算和明确的组合结构。结果显示出一致的“分解→组合”不对称现象:分解技能的训练难以迁移到组合任务,而组合任务的训练更容易回迁到分解任务。我们给出该不对称性的理论解释,并在长度外推、结构分布迁移以及对未见技能的迁移等情境下进一步评估组合泛化能力。最后,针对真实世界的工具调用基准进行初步实验,提供证据表明该不对称性同样存在于实际设置中。

点评

原文链接: https://arxiv.org/abs/2609.19465

[h] 返回首页