NeFut Logo NeFut
EN 管理员登录

[AI学术] 重新思考异构LLM合并:加权模型平均的新视角

发布于:2026-07-22 22:00 最后更新:2026-07-23 12:33
#AI #Machine Learning #optimization

摘要

本文探讨了如何在不进行训练或语义对齐的情况下,通过直接加权平均将具有显著不同参数空间的大型语言模型合并。现有的异构融合方法通常涉及蒸馏、适配器、学习的潜在空间、路由或特征对齐,而我们提出了一个更简单的方案。我们通过无训练的维度适应与比例控制插值来重新审视这一反直觉的问题。

在联合式合并中,我们将较小的模型扩展到较大的参数空间;而在交集式合并中,我们将较大的模型截断到较小的参数空间。在涉及数学推理、代码生成、语言理解、常识推理、知识和指令跟随的Qwen系列模型对及基准测试中,确定性扩展在很大程度上保持了源模型的功能,而小比例插值则能通过转移互补能力来提升强源检查点的性能。

然而,接近平衡的插值往往会崩溃,任务级结果显示出一个跷跷板效应:某些能力的提升与其他能力的回归并存。这些结果表明,简单的参数平均在配合轻量级维度适应和精确控制的比例时,成为异构LLM合并的一个强基线,暗示直接加权融合的极限可能也限制了更复杂的异构合并方法在规模上的成就。

博主点评: 本文提出的方法在异构模型合并上展现了良好的潜力,尤其是在避免复杂处理的同时,利用简单的加权平均与维度调整取得了显著效果,值得深入研究与应用。

原文链接: https://arxiv.org/abs/2607.18026

[h] 返回首页