NeFut Logo NeFut
EN 管理员登录

[AI学术] 统一评论者驱动的混合优势估计:VLM 代理强化学习的新突破

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#AI #Machine Learning #Reinforcement Learning

摘要

大型视觉语言模型(VLMs)如今在交互环境中作为代理行事,成功需要在多个回合中进行连贯的推理和决策。尽管在代理环境中的端到端训练可以提升多回合决策能力,但当前方法主要依赖于对连接的标记轨迹进行逐标记优化或对回合内均匀信用进行逐回合优化。本文建立了两级优化的理论公式,并推导出一种混合优势以服务于这两个目标。

此外,通过适当选择折扣因子和学习目标,我们证明了统一评论者模型可以同时估计逐回合和逐标记的值。因此,我们提出了 HyGAE,一个演员-评论者框架,联合优化混合优势和统一评论者的标记和回合级目标。我们在五个多回合决策环境中对 HyGAE 进行了广泛评估,取得了91%的平均成功率,相较于其他方法显著提升了10%。进一步的分析表明,混合优势和收益的精确解析形式对于优化至关重要。

项目页面:HyGAE

博主点评: 本文提出的HyGAE框架通过结合混合优势和统一评论者,显著提升了多回合决策的性能,展示了在复杂环境中强化学习的潜力。未来可以探索更多优化策略,以进一步提升模型的适应性和效率。

原文链接: https://arxiv.org/abs/2607.23605

[h] 返回首页