NeFut Logo NeFut
EN 管理员登录

[AI学术] UnifiedPlayers:提升工具集成推理的自适应强化学习

发布于:2026-09-18 22:00 最后更新:2026-09-20 12:54
#AI #Machine Learning #LLM

自演化方法通过让使用工具的智能体自行生成训练数据,降低了对人工标注轨迹的依赖。然而,现有方法往往将轨迹生成与评估分离,使用静态验证器,难以适应新出现的失败模式或自一致性信号,导致错误在多条轨迹间相互强化。将规划、执行和评估共同适配可以缓解这些问题,但也带来了协调难题:每个模块不断改变用于训练其他模块的数据或反馈。UnifiedPlayers 通过合作框架解决此难题,包含任务生成的规划玩家、通过 Python 工具调用产生多轮轨迹的执行玩家,以及构建可执行验证器的评估玩家。我们为每个角色设计了专属奖励,并在 GRPO 框架下统一优化,使三者朝向同一学习目标协同进化。实验在两种模型骨干和十二个推理基准上进行,UnifiedPlayers 在数学推理上提升至少 3.5%,在通用推理上提升至少 3.9%,超越最强基线。学习得到的验证器在对抗检测上达到 84.2% 的准确率,其奖励信号的每题方差是自一致性基线的 $2.03\times$,提供了更具区分性的验证。结果表明,专职玩家之间的合作是实现自增强工具集成智能体的有力路径。

点评

原文链接: https://arxiv.org/abs/2609.20089

[h] 返回首页