NeFut Logo NeFut
EN 管理员登录

[AI学术] 模型合并新视角:专家训练时长对LLM效果的影响

发布于:2026-07-16 22:00 最后更新:2026-07-17 08:45
#algorithm #Machine Learning #optimization

在多任务模型合并中,通常将分别训练的专家模型合并为一个能够处理所有任务的单一模型,而无需共同训练。传统做法是在专家模型达到最佳验证损失时进行合并。我们挑战这一常规,通过系统研究领域专家的训练时长如何影响合并模型的质量。

我们对五个领域(数学、代码、指令跟随、多语言和安全)进行了专家的微调,并跨越三种模型规模(Qwen 3.5 0.8B、2B 和 4B)保存从 25\% 到 500\% 的最佳训练步骤的检查点,评估在每个训练时长下的五种合并方法。

我们的研究结果揭示了一个引人注目的方法依赖模式:简单平均在过拟合时急剧下降,而基于稀疏化的方法在超过验证最优时表现最佳。我们通过偏差-方差分解分析对此进行了形式化,借鉴随机森林的原理,其中平均化受益于高方差的个体学习者。这些结果表明,训练时长与合并方法应当共同选择,而非独立决定。

博主点评: 本文通过实证研究揭示了模型合并过程中训练时长的重要性,为后续的多任务学习提供了新的思路,强调了方法选择与训练策略的协同作用,具有重要的理论与实践意义。尤其在当前LLM快速发展的背景下,合理的模型合并策略将显著提升模型性能。

原文链接: https://arxiv.org/abs/2607.11997

[h] 返回首页