NeFut Logo NeFut
EN 管理员登录

[AI学术] 何时不应复用:自主LLM后训练中的条件经验转移

发布于:2026-08-29 22:00 最后更新:2026-08-30 12:07
#AI #Machine Learning #LLM

Large language models (LLM)具备广泛能力,但要适应不断变化的领域、工具和需求,往往需要多次后训练。自主系统可以自动提出更新、训练候选模型,并利用评估反馈决定后续提案。随着证据累积,出现核心问题:在后续训练改变了父模型后,哪些过去的更新证据仍然可用?更新的效果取决于其父模型、数据和训练阶段。把过去的成功视为与上下文无关的许可会浪费计算资源,甚至在子模型被提升后,削弱后续训练轨迹。

我们将该问题形式化为条件经验转移,并提出边界校准干预转移(BCIT)方法。BCIT 在权重改变的训练之前,对经验复用进行授权。其核心步骤包括:

  1. 将观察到的效果绑定到来源上下文;
  2. 检查适用条件;
  3. 对存在明确冲突的候选模型进行否决;
  4. 必要时通过受限的训练试验获取当前状态的证据。 即使候选模型已完成全部训练,仍需遵循统一的采纳规则,且只有观察到的事件会被记入记忆。

在一个4B参数模型上进行金融推理、文本到SQL、函数调用等三类任务的适配实验中,候选更新在不同评估上下文表现出异构的目标和保留效果。对比在相同候选、证据和计算预算下的其他方法,BCIT 授权的有害更新更少,最终模型质量更高,证明经验授权应作为自主后训练的独立问题来处理。

博主点评:BCIT 通过显式绑定上下文和冲突检测,提供了更安全的经验复用框架,值得在实际自主微调系统中推广。

原文链接: https://arxiv.org/abs/2608.26730

[h] 返回首页