摘要
模型合并被提倡作为联合多任务训练的替代方案,然而在强化学习的环境中,这种替代方案几乎从未与其声称替代的基准进行测试:合并独立发布的代理是因为没有可用的联合模型。我们建立了缺失的比较。
通过在 AppWorld 代理基准上使用 LOOP 训练困难级别为 1 和 2 的 Qwen3-8B 专家,我们将其合并(TIES, RAM+),并将结果与在同一数据上联合训练的模型进行对比。在任务目标完成方面,合并结果与联合强化学习相匹配——且每种合并变体在统计上无显著差异。
为了说明为何合并方法在此处并不重要,我们测量了专家的任务向量几何,这些向量几乎没有任务采样噪声:尽管有约 65% 的支持重叠,它们几乎正交(余弦相似度为 0.06 - 0.10),并且随着训练的进行,存在一个小的共享方向。我们将其与随机初始化的底线和同次运行的上限进行校准,以确认这反映了学习,而非低秩参数化。
由于方向和支持是解耦的,基于支持和符号的合并(RAM, TIES)趋向于接近均匀平均。我们发布了所有代码和统计数据。
博主点评: 本文通过几何分析揭示了模型合并在多任务强化学习中的有效性,强调了任务向量的几何特性对于理解合并方法的重要性。尽管合并与联合训练的结果相似,但研究者们应关注于合并策略的选择及其对训练效果的潜在影响。