本文研究了 Agent harness 在零售和航空场景中的价值来源。我们将代理的核心功能拆解为三部分:
- 规划信息(提供任务指导);
- 执行组织(调度子任务并记录状态);
- 完成检查(通过只读终端验证结果)。\ \ 实验使用了两套零售实验和一个航空试点,全部在 $\tau^2$ 基准上进行。为 isolating 规划内容的贡献,我们构造了两种对照:
- Fixed:预先编写的、任务专属的完整计划;
- Sham:与 Fixed 等字数的随机策略文本。\ \ 在 265 对匹配的实验单元中,Fixed 相比 Sham 在经 Oracle 验证的成功率上提升了 7.17 个百分点(90% 任务聚类自助区间 1.15–13.36),提升主要出现在高复杂度任务上。\ \ 只读终端验证器能够拒绝 61% 的零售 Oracle‑invalid 结果,仅以每集不足一分钱的额外成本误拒 17% 的正确结果。\ \ 关键发现是:
- 当错误接受的损失(liability)较低时,规划信息的增益主导整体收益;
- 当损失较高时,验证器避免的错误通过收益占主导;\
- 单独使用验证器即可捕获几乎全部的误通过收益,且成本仅为完整规划‑验证组合的 fraction。\ \ 点评:该工作揭示了在有状态 LLM 代理系统中,规划与验证的成本‑效益权衡。对于高风险场景,轻量级的只读验证器可能比复杂的任务规划更具实际价值。