NeFut Logo NeFut
EN 管理员登录

[AI学术] Reach 还是 Solve?通过检查点交接归因代理式强化学习收益

发布于:2026-09-18 22:00 最后更新:2026-09-20 12:54
#algorithm #Machine Learning #LLM

强化学习已经能够训练语言模型代理,在实时环境中执行数十步。收益显著,常被解释为决策能力提升。由于代理在闭环中自行生成输入,后续观察由其早前动作决定,导致同一任务中 SFT 检查点和 RL 检查点在不同状态上被评估。端点成功混合了两个因素:代理到达的位置以及到达后所做的动作。仅在两策略都能到达的状态上比较并不能分离这两者,因为这种限制本身是对结果的选择,在我们的数据中会导致效应符号翻转。为此我们提出“检查点交接”评估协议:复制一个检查点达到的状态并交给另一个检查点继续执行,且不进行再训练。通过在 SFT 与 RL 之间交叉“到达者”(reacher) 与 “求解者”(solver) 角色,可将端点收益拆分为 REACH 与 SOLVE 两部分。REACH 衡量策略到达一个环境确认距离成功固定步数的状态的频率;SOLVE 衡量在相同克隆状态下完成任务的频率。我们在两个基准和两套独立发布的流水线中进行实验,所有五种条件下 REACH 与 SOLVE 的交互均为正向。RL 的历史对 RL 求解者的价值高于对 SFT 求解者的价值。在 ALFWorld 上,RL 同时提升了两项指标,且 SFT 求解者从未在 RL 求解者失败的情况下成功。独立的 REACH 与 SOLVE 差距能够预测整体交互效果。交接只要求一个检查点的历史能够在另一个检查点下重放,从而在长时域评估中同时报告到达与完成,而不仅是端点成功。

点评

原文链接: https://arxiv.org/abs/2609.19636

[h] 返回首页