NeFut Logo NeFut
EN 管理员登录

[AI学术] PATS:政策感知的强化学习训练支架

发布于:2026-07-25 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #Reinforcement Learning

摘要

在长时间跨度的LLM代理强化学习中,弱策略常常重复类似的失败,导致信息量不足的回滚轨迹,从而限制了有效的策略优化。现有的以技能为中心的方法通过优化、筛选或内化可重用技能来提高探索性。然而,这些方法仍然以技能本身为中心,而非设计为适应性训练时间支持以适应不断发展的策略。

为了解决这个问题,我们提出了一种以政策为中心的训练范式,将技能重新定义为动态训练支架。我们的框架PATS将最新策略的回滚组转换为证据卡,并利用任务特定评估来调整后续回滚中使用的上下文。具体的指导帮助弱策略完成具有挑战性的任务。

随着策略的改善,多余的上下文被修订或移除,以减少对显式指导的依赖,同时保留有用的回滚变异。政策通过标准的RLVR使用环境奖励进行优化,训练支架在部署时被丢弃。

在ALFWorld和WebShop上,PATS相较于强基线提高了最多18.6%。在七个增强搜索的问答基准上,它在使用比基线少32.1%的提示标记的同时,仍保持竞争力。

博主点评: PATS通过将技能转化为动态支持机制,显著提升了弱策略的表现,展现了政策优化的新思路。其在多种环境中的有效性验证了在强化学习中灵活适应性的必要性,为未来的研究提供了重要的启示。

原文链接: https://arxiv.org/abs/2607.21419

[h] 返回首页