NeFut Logo NeFut
EN 管理员登录

[AI学术] UpgradeBench:面向升级决策的微调LLM专家基准

发布于:2026-08-24 22:00 最后更新:2026-08-29 12:04
#AI #Machine Learning #LLM

UpgradeBench 是一个聚焦模型升级决策的纵向基准,覆盖四个连续的 Qwen 版本、一个续训检查点、六个任务以及两种模型规模,并补充了具有已知训练血缘的 OLMo 检查点。基准围绕三个核心问题展开:新检查点是否提升固定配方重新训练的专家性能、专业化资产在版本之间的可迁移性以及可利用的恢复资源。

实验发现升级收益在不同任务‑规模‑发布周期上差异显著。某些重新训练基线在新版本上有明显提升,而另一些仅在训练噪声范围内波动;持久性从文本到 SQL 任务的不到一次发布间隔到意图分类任务的超过十四个月不等。直接复制适配器的成功率既不受模型架构也不受模型族影响:在 OLMo 上,经过 46 B‑token 的继续预训练后保留率在 0.88‑0.99 之间,但在 2.9 T‑token 时降至零;退火和模型混合不会额外带来伤害,迁移能力随继续预训练距离衰减。

在保留输入数据的前提下,教师重新标注能够在无需全新金标注的情况下恢复目标基准的专家,尽管计算节省并非必然。对 33 次升级情景模拟固定决策策略得到平均 0.37 pp 的质量后悔,且行为回归为零,计算和标注成本仅为全量重新训练的三分之一。一个基于 256 条提示的轻量 CKA 探针能够预测跨版本适配器可移植性(Spearman 0.74,覆盖八对模型)。

我们公开了每条样例的预测、成本日志、数据划分清单以及评估代码。

博主点评:UpgradeBench 为实际部署中的模型升级提供了系统化的实验框架,尤其是对适配器迁移和计算成本的细致量化,为企业在新模型发布时做出更具依据的决策提供了有力参考。

原文链接: https://arxiv.org/abs/2608.20918

[h] 返回首页