代理框架决定大语言模型(LLM)如何获取上下文、调用工具、验证结果、维护状态以及何时结束,这直接影响代理的整体表现。不同任务对框架机制的需求差异显著:某些机制在特定任务上提升效果,却可能在其他任务中引入额外开销或上下文干扰,导致全局统一框架的次优表现。我们将这种次优归因于固定机制选择导致的任务不匹配,因而提出任务特定框架的构建思路。
直接为每个任务生成框架代码会带来生成与调试成本,并且随着生成机制数量增加,执行风险会叠加。为缓解这些问题,我们从失败任务轨迹中挖掘出可复用的框架原语(Harness Primitives),每个原语都有明确的适用范围和组合契约。基于这些原语,我们设计了 STITCH 框架:在测试时根据任务信息挑选合适的原语,并将其编译成任务特定的框架,而无需在运行时生成或修复代码。
实验表明,STITCH 能显著提升框架的适配性和鲁棒性,随着原语库规模扩大,任务成功率相较固定框架基线提升最高 12 分,且超越了人工设计的 Codex CLI 框架。同时,STITCH 的测试时框架组合开销仅为 2.7%,比从零生成任务特定框架快 638 倍。
这些结果证明,构建任务自适应的代理框架对完成多样任务具有实际价值,而构建可复用的原语是实现该目标的可行路径。
点评