NeFut Logo NeFut
EN 管理员登录

[AI学术] REGEN:利用重播回收实现专家到通用的离线强化学习知识蒸馏

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#Reinforcement Learning #Offline RL #Knowledge Distillation

在大规模在线强化学习(RL)的背景下,如何有效地实现长期推理和工具使用能力的提升成为一大挑战。尽管多教师在线策略蒸馏(MOPD)为知识蒸馏提供了新的思路,但其仍需结合推理和反向传播,限制了扩展性和计算效率。为此,我们提出了REGEN:即通过重播回收实现专家到通用的蒸馏过程。

REGEN的创新之处在于,它不再依赖多个教师模型进行蒸馏,而是通过回收教师模型专门训练的重播记忆,结合离线RL算法进行训练。这一方法完全解耦了采样与反向训练的过程,从而显著降低了训练成本。

在数学推理、代码生成和指令跟随等任务中,REGEN在成本大幅降低的同时,准确性与MOPD相当。最终,REGEN有望将在线RL转变为数据合成过程,而非一次性的学习阶段,且能够在大规模后训练中推广,而无需重负载的计算。

博主点评: REGEN通过创新的重播回收机制,显著提高了强化学习的效率和经济性,展现了在多任务学习中的广泛应用潜力。其方法论不仅降低了计算资源的需求,也为未来的强化学习研究开辟了新的方向。

原文链接: https://arxiv.org/abs/2607.19450

[h] 返回首页