NeFut Logo NeFut
EN 管理员登录

[AI学术] 当特权指导不匹配:状态匹配路由和上下文自蒸馏用于多回合代理

发布于:2026-08-07 22:00 最后更新:2026-08-08 01:08
#Machine Learning #Artificial Intelligence #DeepSeek

特权在线指导为多回合代理提供了密集的监督,允许同步的教师在每个回合重新评分学生的响应,并访问训练仅有的参考,例如成功的轨迹。然而,在交互式环境中,学生的前一动作不断改变执行状态。当学生采取不同的动作或以不同的顺序完成子目标时,其展开可能会达到参考没有覆盖的状态,使得参考成为不可靠的指导源。因此,特权蒸馏的应用会产生状态-参考不匹配。 为了解决这个问题,我们引入了状态匹配路由和上下文自蒸馏(SMRC-SD),它明确确定了何时和如何使用特权轨迹来指导在线学生。在每个回合中,SMRC-SD都会验证学生的当前执行状态是否与参考轨迹上的支持状态相匹配。仅在匹配状态下应用蒸馏,过滤掉参考缺乏局部兼容指导的回合。对于每个匹配状态,SMRC-SD进一步从成功轨迹中构建状态条件教师上下文,监督以实际到达的状态为基础。 在ALFWorld和WebShop上,SMRC-SD始终优于无条件的成功全路径蒸馏。使用Qwen3-1.7B,它将ALFWorld上的任务成功率从$0.746$提高到$0.865$,将WebShop上的任务成功率从$0.574$提高到$0.693$。受控路由和上下文消融支持选择局部支持回合和构建状态兼容教师上下文是这些收益的贡献者。 代码可在https://github.com/liujunzhuo/SMRC-SD找到。 博主点评: 本文提出了一种新颖的方法,解决了特权指导在多回合代理中的不匹配问题,通过状态匹配路由和上下文自蒸馏提高了代理的性能,

原文链接: https://arxiv.org/abs/2608.05219

[h] 返回首页