构建可在工业环境中部署的通用智能体需要将多个能力逐步整合,每种能力往往在不同的训练阶段获得。然而,当前缺乏系统的智能体持续学习(ACL)方案,对现有集成范式的权衡也认识不足。为填补这一空白,我们提出 ACLArena,一个用于全面研究、分析和评估 ACL 的框架。
我们首先搭建了一个顺序训练流水线,并从模型层面和 token 层面两条互补视角深入剖析遗忘与泛化机制。模型层面的分析关注参数分布的漂移,token 层面的分析则考察语义表示的保持程度。基于这些洞察,我们系统比较了三种典型方法:多教师 on‑policy 蒸馏、自蒸馏微调以及模型合并,评估它们在恢复已有能力的同时保持新学能力的效果。
实验表明,能力在不同阶段之间的迁移呈现出可预测的模式:蒸馏在保持旧能力方面表现稳健,但对新能力的适应较慢;自蒸馏能够快速适应新任务,却容易出现遗忘;模型合并在特定条件下能够兼顾两者。
基于上述结论,我们提出了一套新的 ACL 方案:利用高质量轨迹进行离线回放,并引入一个路由网络,由多个 LoRA 专家组成,每个专家通过强化学习专注于特定子任务。该方案显著提升了智能体在多个领域的跨阶段学习能力。
我们在四个推理与行为任务上进行全面实验,分别在域内和域外设置评估,结果验证了分析的价值和新方法的有效性。
点评:ACLArena 通过细致的遗忘/泛化分析和系统的对比实验,为 ACL 提供了清晰的研究路径,并提出的 LoRA‑路由方案在实际多任务场景中展现出强大的持续学习潜力。