LLM 代理正通过编写并复用文本技能实现自我提升,这些技能要么保存在全局单一文档中,要么以平铺的任务条目池形式存在。然而,这两种方式的实验主要集中在结构相似的任务域上。对于每个任务都需要不同解法的长时序工作负载,这两种形式各有缺陷:全局文档会退化为通用纪律,条目池则会膨胀且条目始终绑定到生成它们的实例。我们认为缺失的复用单元是由一组相关任务共享的求解过程,并围绕这一思想构建了 SkillGLoW(Global‑Local Weave)。具体做法是:任务在执行过程中产生的局部技能被聚合为“过程族”,随后压缩为去实例化的全局先验;而实例细节不再存储,而是在每次任务执行时重新生成。一个提交门控机制确保只有在实际执行未导致库性能下降时才接受新的先验。
在四个基准(数学推理、终端自动化、软件修复、具身控制)和三种模型的实验中,SkillGLoW 的全局先验相较于无技能基线平均提升了 17.2 分(hard),在全部 12 次持续改进运行中均呈正向增益,局部再生成时提升至 18.0 分。库中仅保留每个过程族的一个先验,压缩率为每任务池的 3.6 倍。使用相同协议时,GLoW 在 21 项实验中的 15 项上超越了已发布的单文档优化器。未做任何修改的情况下,SkillGLoW 将在未见 ALFWorld 任务上的成功率从 73.9% 提升至 83.9%,表明真正迁移的是求解过程而非任务记忆。
点评