长时程智能体在一次运行中会产生大量经验,这些经验既能提升当前任务的执行,也能为后续任务提供改进依据。传统的自我改进方法往往在整个运行结束后才处理这些经验,导致无法在运行期间实时调整策略或立刻验证新学到的技巧。
我们认为自我改进应当是 实时 的,即在经验产生的同时即刻用于两件事:一是引导正在进行的执行,二是更新持久化的模型或记忆库。现有的智能体架构难以同时满足这两个需求。单体自纠正把任务执行和轨迹评估放在同一上下文中,缺乏外部监督的灵活性;子智能体委派虽然将执行拆分,但通常无法在子智能体运行时对其进行重定向。
为此我们提出 PILOT(Supervisor‑Worker Harness),通过两条耦合机制实现实时自我改进:
- 实时引导(live steering):一个独立的监督者可以在子任务执行过程中对工作者进行重定向或中止,从而即时纠正错误路径。
- 实时自演化(live self‑evolution):在执行过程中提炼出成功的过程和失败模式,生成可复用的技能和记忆,供后续任务直接调用。
在两个冻结的底层模型(GLM‑5.1 与 Kimi‑K2.6)和三个基准测试上进行评估,PILOT 在六种配置中的五种中排名第一。在 Terminal‑Bench 2.0 上,PILOT 的得分比对照系统高出最多 9.8 个百分点。在自我改进设置下,GLM‑5.1 提升 14.6 分,Kimi‑K2.6 提升 12.4 分。平均输出 token 数分别下降 42.9% 与 47.4%,而每百万输出 token 的成功评估次数分别提升 110.3% 与 134.0%。
博主点评:PILOT 的设计巧妙地将监督与执行解耦,使得长时程智能体能够在运行时自我纠错并快速积累可复用的知识。实验结果表明,这种实时自我改进框架在效率和效果上都有显著优势,值得在更大规模的任务中进一步验证。