同一语言模型在不同的 harness(框架)下表现会有显著差异。本文以同一模型、相同任务为前提,比较了两种 harness 配置在三个编码基准上的结果。控制组按照时间顺序完整提供对话上下文;处理组在上下文填满时,会机械地压缩较早的工具输出,以腾出空间并对重复或停滞的工作作出响应。
在紧凑上下文窗口下,处理组在所有三种压力比较中提升了每任务的失败到通过比例(F2PF),并在 SWE‑bench Verified 与 SWE‑bench Pro 上增加了完整解的数量。紧窗口 Verified 实验使用 169 任务、20480 token 窗口、480 秒固定结束时间;在该批次中,处理组将平均 F2PF 从 28% 提升至 49%,完整解比例从 43% 提升至 72%。在不对模型进行特定微调的情况下,同一冻结的处理组同样提升了另外三种结构不同模型的两个指标。
在宽窗口 Qwen3.6 实验中,Verified 与 Pro 的整体结果相近,而 FeatureBench 在处理组下仍保持更高的平均 F2PF。宽窗口 Verified 实验中,处理组每轮使用的提示 token 更少。由于改变 harness 改变了固定模型权重的可达能力,评估编码代理时应将模型与 harness 视为整体求解器。
博主点评:这项工作提醒我们,评估大型语言模型时不能忽视执行环境的设计,甚至在模型保持不变的情况下,框架的细节也会显著影响实际表现。