NeFut Logo NeFut
EN 管理员登录

[AI学术] 多套件强化学习学到了什么?代码代理的信用分配与可迁移性

发布于:2026-09-07 22:00 最后更新:2026-09-08 00:37
#algorithm #AI #Machine Learning

本文研究了在代码生成任务中使用多套件(multi‑harness)强化学习的效果。作者从一个 Qwen3‑8B 的监督预训练模型出发,固定任务套件记录(Aider、OpenHands、Qwen Code、SWE‑agent),在相同更新次数下比较两种组相对策略优化(GRPO)规则:Within(每个任务‑套件对单独成组)和 Cross(同一任务下的套件合并成组)。每个检查点使用封闭的 SWE‑bench Verified Oracle 在四个源套件以及一个未见套件上评估。

评估套件是主要变量:在 24,000 次封闭评估中,平均解答率从 $2.14\%$ 上升到 $9.27\%$,提升因子约为 $4.3$,而训练配方本身仅提升 $1.16$ 倍。分组规则的影响不显著。对未见套件的结果显示,Cross 相比 Within 的提升为 $+0.25$ 百分点(95% 置信区间 $[-0.48, +1.02]$),在八次尝试下;在三个随机种子上整体提升 $+0.16$(置信区间 $[-0.41, +0.72]$),且单个种子的估计甚至符号相反。每个规则自身的种子波动范围 $0.42\sim0.45$ 百分点,已超过两者差异。

两种规则的最大收益都来自同一源套件。利用交叉套件的优势可以训练出一个折叠分类器,以 $+4.48$ 百分点的优势从 Cross 的优势中恢复出生成套件,而 Within 则无法实现。即便如此,两种规则在每个套件内部的持有分数和动作分布仍相同。重新收集一半的训练数据进行在线学习也未改变上述结论。

结论是,跨套件的信用分配能够带来配置适应,但并未提升可迁移的能力。作者建议在报告多套件 RL 实验时,明确分组边界并在未见套件上进行测试。

点评

原文链接: https://arxiv.org/abs/2609.04518

[h] 返回首页