NeFut Logo NeFut
EN 管理员登录

[AI学术] CIGPO:多轮证据阅读智能体的上下文信息增益策略优化

发布于:2026-07-22 22:00 最后更新:2026-07-23 12:33
#AI #Machine Learning #optimization

在多轮证据阅读智能体的训练过程中,仅依靠结果的强化学习会导致不稳定,因为中间的回合很少获得直接的奖励。在HotpotQA实验中,使用Qwen2.5-3B-Instruct的GRPO初期有所改善(标准F1为0.430),但随后崩溃至100%格式违规输出。训练日志的诊断揭示了一个零优势锁定机制:所有采样的轨迹都获得最低的格式惩罚(-2.0),群体相对优势消失,策略梯度损失变为零——形成优化死锁。

为了解决这一问题,我们提出了一种方差注入策略:通过为中间的证据阅读回合分配每回合奖励,防止群体奖励分布崩溃到单一值,从而保持GRPO所需的方差。上下文信息增益策略优化(CIGPO)实现了这一策略,利用冻结参考模型对真实答案的对数似然的边际增加作为每回合信号。通过对IG和F1奖励的单独归一化以及IG加权课程,CIGPO在HotpotQA的3B规模上达到了标准F1的0.518(从0.252的基础提升了105%),相比之下,最佳GRPO检查点为0.430,最终GRPO检查点为0.000。CIGPO在整个训练过程中保持了有意义的奖励方差,避免了零优势锁定。这些结果明确指出了仅基于结果的GRPO的奖励方差崩溃作为具体的失败模式,并展示了回合级IG奖励如何在HotpotQA设置中防止这一问题。

博主点评: CIGPO的方法通过引入回合级奖励,成功地解决了传统GRPO方法的优化死锁问题,为多轮证据阅读任务提供了一种新的思路。未来的研究可以进一步探讨如何在更复杂的环境中应用此策略,以提升智能体的学习效率和效果。

原文链接: https://arxiv.org/abs/2607.16244

[h] 返回首页