本文考察了编码 harness 如何影响自主编码代理在长时程软件工程任务中的表现。我们构建了一个执行循环固定、但在规划、动作空间和上下文管理三方面可替换的轻量 harness,并在 SWE‑Bench Verified 与 Terminal‑Bench 2.1 上对四种模型进行实验,覆盖 176 种配置,包括五种上下文管理策略、四种上下文窗口预算以及针对规划和动作空间的消融实验。实验发现:
- 当上下文窗口预算收紧时,上下文管理的价值显著提升,主要通过避免上下文溢出导致的失败实现。
- 先使用规则化的省略再交给 LLM 总结的策略在效率上最优,而让省略内容可恢复的做法几乎不被模型利用,且未提升准确率。
- 对弱模型而言,规划提供准确性支撑;对强模型则更多充当成本节约手段,准确率变化不大。
- 预定义工具对缺乏 bash 能力的模型有帮助;具备 bash 能力的模型在仅使用 bash 接口时即可保持高性能,并在以命令行为主的任务上显著降低成本。
轨迹层面的分析表明:上下文管理延长了执行轨迹但不改变代理行为;规划决定了轨迹何时终止;动作空间决定了代码生成的粒度。这些结论为基于模型能力和预算的 harness 设计提供了指导,并构建了一个模块化的评估框架。
点评