NeFut Logo NeFut
EN 管理员登录

[AI学术] 突破性的多回合在线策略蒸馏方法:ReOPD

发布于:2026-07-19 22:00 最后更新:2026-07-22 01:02
#AI #Machine Learning #DeepSeek

在这篇研究中,我们探讨了在线策略蒸馏(OPD)在智能任务中的应用,尤其是当大型语言模型(LLM)代理与环境进行多回合交互时,学生如何模仿教师的多回合交互历史。传统的在线OPD方法代价高昂,因为每次更新都需要通过环境进行新的学生回合和在访问历史上进行教师查询。

为此,我们提出了重播前缀在线策略蒸馏(ReOPD),这是一种离线的替代方案,通过重用预先收集的教师轨迹作为重播前缀来降低成本:学生在选定的步骤上进行操作,而教师在每一步提供密集的监督,无需执行新的环境交互。

我们的研究表明,多回合OPD存在前缀陷阱:使历史更符合学生的策略可以提高与学生的相关性,但可能会在目标不可靠的历史上查询教师。这造成了学生占用率与教师可靠性之间的双重分布转移。ReOPD通过将多回合OPD视为一种可靠性意识的前缀分布设计来解决这一问题,并实现了一种简单的步长衰减采样策略,强调早期、低偏移的前缀。

在涉及Python的数学推理和多种教师与学生模型规模的搜索环境中,ReOPD保留或提高了OPD级别的准确性,在学生训练期间使用零工具调用,并且每次回合的速度至少比OPD快4倍。因此,ReOPD将昂贵的代理-环境交互转变为可重用的离线资源,使得在工具、任务和环境之间实现可扩展的蒸馏成为可能。

博主点评: ReOPD的提出为在线策略蒸馏的高成本问题提供了创新的解决方案,通过重用教师轨迹显著提高了效率,值得在更多实际应用中探索其潜力。尤其在多回合交互场景中,如何平衡学生与教师之间的可靠性,将是未来研究的重点。

原文链接: https://arxiv.org/abs/2607.04763

[h] 返回首页