AI 代理可以把从过去任务中学到的内容外部化为可复用的技能,例如流程、检查清单、代码或其他可执行工件,并在解决新任务时检索使用。自演化技能方法在每轮训练任务后重写这些技能,随后在同类新任务上使用。我们研究一个核心问题:技能在训练任务上的提升是否会迁移到未见的测试任务。我们在六个基准上评估了五种自演化方法和一种一次性技能,所有实验使用相同的模型、相同的代理以及相同的训练/测试划分。共有 21 项在训练任务上取得改进的技能,其中 5 项在测试任务上全部保留改进,13 项部分保留,3 项完全失效。没有一种现有方法在所有基准上表现最佳。通过阅读技能内容发现,迁移效果差的技能往往修正了应随任务变化的细节,如列名、输出文件,或把针对一次失败的修复写成对所有任务的规则。一个读取技能内容的 LLM 判官能够在 86% 的配对中给出与实际测试结果相同的排序,但它对单次编辑的影响预测较差,仍需通过实际运行验证。基于这些观察,我们提出了通用技能优化(GSO)框架:仅保留编写技能的指南,为每个任务重新生成技能,该方法在六个基准上均取得最高分。
点评