NeFut Logo NeFut
EN 管理员登录

[AI学术] 反馈增强自蒸馏为何未能改善检索交错搜索代理的表现?

发布于:2026-07-22 22:00 最后更新:2026-07-23 12:33
#AI #Machine Learning #optimization

在大型语言模型的训练中,基于策略的自蒸馏(OPSD)提供了一种有前景的方法,无需依赖单独的教师模型。然而,它在复杂的代理任务上的有效性仍然未被充分探讨。

本研究中,我们实现了反馈增强自蒸馏(FA-SD),这是一种针对代理搜索的自蒸馏算法,利用成功的演示作为特权信息。我们发现模型可能依赖于重复的推理与搜索输出模板,生成的轨迹看似多样,但在很大程度上与输入问题无关,这导致基于KL的自蒸馏信号缺乏信息性。我们将这种现象称为解码崩溃,这是一种现有评估指标可能忽视的失败模式。

为了理解其根本原因,我们展示了尽管自教师模型的表现更强,学习过程仍然内在不稳定,原因在于监督信号的不一致性。我们进一步将这种不一致性分解为模型不一致性和提示不一致性,并展示后者显著降低了监督信号的质量,限制了自教师学习的有效性。为了解决这种不一致性,我们引入了指数移动平均(EMA)教师,以稳定自教师并提供更一致的监督信号。尽管EMA教师在预热阶段可能导致性能暂时回落,但最终通过提供更稳定的监督信号改善模型表现。

博主点评: 本文揭示了自蒸馏算法在复杂任务中的局限性,尤其是解码崩溃现象的影响,提出了EMA教师作为解决方案,展现了在不稳定学习环境中如何提高模型性能的思考,具有重要的理论与实践意义。探索模型不一致性与提示不一致性,为未来研究提供了新的视角。

原文链接: https://arxiv.org/abs/2607.17558

[h] 返回首页