NeFut Logo NeFut
EN 管理员登录

[AI学术] 模型预训练的最后窗口:超越微调评估的新维度

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#AI #Machine Learning #optimization

摘要

开发者通过模型的行为来评估模型的检查点。在监督微调(SFT)后,两个在相关基准上表现相似的检查点被视为可互换,准备好进入下一个对齐阶段,通常是偏好优化。我们质疑这种判断是否忽略了预训练的印记:一种在后SFT基准中无法揭示的差异,却决定了每个检查点在进一步训练时的响应。

为了探究这一点,我们在预训练的最后窗口进行了一项对照实验,即在指令调优之前最后训练的数据。我们从一个部分预训练的检查点分叉出六个分支,仅在这一窗口上有所不同:500百万个标记,占之前标记的0.1%到1%。每个分支在单一数据源上训练其窗口:通用网页文本、过滤后的网页文本、规范性话语、安全文本、数学文本或合成教育文本。SFT和后训练过程完全相同。

在SFT后,这些分支的行为几乎完全相同,在指令跟随、拒绝和能力上相差不超过一分,然而相同的后训练却将它们带到了非常不同的终点,无论是直接的偏好优化更新还是带有可验证奖励的强化学习更新。我们通过对有害请求的拒绝来测量这种偏差:在后训练开始时,安全文本分支拒绝的比例与网页文本分支相差无几,但到最后,它失去的拒绝比例远低于其他分支。其他四个分支几乎没有保护效果,因此这一影响是选择性的,依赖于窗口中包含的内容。

保护效果要求安全文本在预训练的最后到达,而不是更早到达,并且在第二个模型家族中得以重现。因此,模型最后的预训练内容决定了其对对齐的反应。因此,检查点不应仅通过其后SFT行为进行评估,最后训练的内容也应与其一同报告。

博主点评: 本文揭示了模型预训练阶段的最后窗口对其后续行为的深远影响,强调了在模型评估中考虑训练数据的时序性的重要性。此研究为模型微调提供了新的视角,提示我们在选择和评估模型时,不能仅依赖于表面性能,需深入分析其训练背景。

原文链接: https://arxiv.org/abs/2607.25063

[h] 返回首页