NeFut Logo NeFut
EN 管理员登录

[AI学术] 从模仿到自主策略优化:Agentic-DPO 的崭新探索

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:47
#AI #Machine Learning #optimization

摘要

大型语言模型(LLM)代理通常通过监督微调(SFT)从专家轨迹中训练,这种方法将多轮代理行为视为普通文本模仿。这种方法简单且成本低,但仅学习模仿专家行动的序列,而未能训练代理在每个状态下选择正确的行动以应对可能的错误。

现有的解决方法包括偏好学习或强化学习,但这些方法通常需要高成本的环境回滚和奖励模型。我们提出了 Agentic-DPO,这是一种轻量级的离线代理策略优化方法,将专家轨迹转化为状态条件的偏好监督。在每个专家行动状态下,Agentic-DPO 从当前状态中采样一步行动,将合理的错误行动视为负样本,并使用 DPO 风格的偏好目标与专家行动进行对比。

为了避免在偏好学习中混合策略和模式,我们引入了保持策略增强(Policy-Preserving Augmentation, PPA),该方法在保持专家策略不变的情况下,在多个模式下呈现相同的潜在轨迹。Agentic-DPO 无需在线环境回滚、奖励模型或全轨迹学生探索。

我们在 StableToolBench、tau-bench retail 和 Mind2Web 上进行了实验,Agentic-DPO 在不同模型规模上始终提升代理性能,超越了单纯的模仿。特别是,它将 tau-bench 的准确率从 21.7%(SFT)提高到 41.4%,对于 9B 模型,在相同的基础上仅依赖步骤级回滚,而无需在梯度步骤中进行环境交互。这些结果表明,专家轨迹在转化为状态级行动偏好后,可以支持低成本的自主策略优化。

代码已发布在 Agentic-DPO GitHub

博主点评: Agentic-DPO 方法在优化代理学习效率上展现出巨大潜力,特别是在没有在线环境交互的情况下,能够有效地从专家轨迹中提取价值。这为后续的研究和应用提供了新的思路,尤其是在资源有限的情况下,值得深入探索其应用场景。

原文链接: https://arxiv.org/abs/2607.10601

[h] 返回首页