NeFut Logo NeFut
EN 管理员登录

[AI学术] AdaKP:面向推理的强化学习在线自适应知识点选择

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#algorithm #Open Source #Reinforcement Learning

摘要

强化学习与可验证奖励的结合是一种强有力的方法,能够在大型语言模型中引导推理,但在竞赛级数学问题上却面临严重的奖励稀疏问题。常见的解决方案是将原子知识点(KPs)——从黄金解中提取的简短自然语言提示——注入到提示中。然而,现有方法要么在离线时固定选择,要么仅仅扩展注入文本的单一量,而忽略了最重要的选择维度:何时以及选择哪一子集的原子知识点。我们提出了AdaKP,一种在线选择器,它在强化学习训练过程中重新选择每个问题的知识点子集。

在其核心,AdaKP使用一个熵代理,根据其对下一个token熵的减少来评分每个知识点——仅需一次廉价的前向传递,并且在其截断偏差上有可证明的界限,替代了代价高昂的回滚估计。三个轻量级机制使得该信号在在线环境中可用:一个动量平滑器来吸收每步的噪声,一个退休与复活管理器来修剪弱知识点,同时保留探索,以及一个自适应调度器来优先进行早期训练中的重新评估。AdaKP还贡献了一个飞行前验证门,确保代理在任何高成本运行之前与留一法的真实值进行验证,将方法级风险转化为可验证的检查。

作为标准DAPO+GRPO训练器的完全可加分支,AdaKP在不改变优化器的情况下,在所有八个竞赛数学基准上超越了强静态选择基线,确立了在线、经过验证的知识点子集选择作为推理导向强化学习中尚未充分探索的实践方向。

博主点评: AdaKP通过引入在线动态选择机制,显著提升了强化学习的效率和准确性,尤其是在高复杂性数学问题上,这为未来的研究提供了新的思路和方向。其轻量级设计和验证机制也显示出极好的实用性,值得深入探讨。

原文链接: https://arxiv.org/abs/2607.24833

[h] 返回首页