在线部署的智能体会产生大量执行轨迹,但对每个任务进行人工验证和标注成本高。我们探索如何在没有后置结果标签的情况下,从轨迹中提取可复用的反馈,依据局部进展、恢复行为和未完成需求的证据。
提出 DENSE(Distilling Evidence from Nested Subtask Executions),它把这些证据组织成证据驱动的嵌套快捷树。树结构压缩冗余尝试,利用恢复证据在不同层级调和冲突,汇总已完成分支并展开未解决分支,将已有进度与剩余义务关联。
为评估反馈质量,设计 REFIT 协议:在后置结果盲化的前提下,使用相同的初始轨迹作为源,重置环境和模型上下文,让不同模型重新尝试相同任务,比较得到的反馈。
在 Terminal-Bench 2.1 基准上,DENSE 在四个接受模型中实现了最高的严格通过率,优于所有非特权反馈方法。相较于原始执行,严格通过率提升 7.12‑15.64 个百分点,且在重跑时观察到的接受模型 token 数减少 19.0‑43.6%。GPT-5.5 的消融实验表明,嵌套子任务分析、快捷树构建和问题调和三者缺一不可。
这些结果表明,基于证据的轨迹复用能够帮助智能体自我精炼,降低对外部监督的依赖。
点评