深度研究代理通过外部工具扩展大语言模型,以多轮推理回答复杂的长时程问题。持续改进依赖于对既往经验的学习,但已有方法要么检索冗长的任务轨迹,增加决策负担,要么仅蒸馏与下游策略脱钩的过程技能。APEx 提出层次化经验利用框架,将交互历史组织为实例级轨迹记忆和类别级过程技能,并通过 Executor、Distiller、Planner 的闭环结构耦合。三阶段交替的 GRPO 训练使得奖励引导的技能蒸馏取代固定提示生成。测试时,蒸馏得到的技能作为过程先验,引导 Planner 进行在线的技能引导强化学习,实现无真实标签的自我提升,并通过技能对齐正则防止策略漂移。实验在 7 个基准上验证,APEx 超越 GPT-5.4 14.7 分,领先最强记忆增强基线 3.0 分。
点评