NeFut Logo NeFut
EN 管理员登录

[AI学术] DENSE:将智能体轨迹蒸馏为基于证据的快捷树以实现自我精炼

发布于:2026-09-21 22:00 最后更新:2026-09-22 02:29
#algorithm #AI #Machine Learning

在线部署的智能体会产生大量执行轨迹,但对每个任务进行人工验证和标注成本高。我们探索如何在没有后置结果标签的情况下,从轨迹中提取可复用的反馈,依据局部进展、恢复行为和未完成需求的证据。

提出 DENSE(Distilling Evidence from Nested Subtask Executions),它把这些证据组织成证据驱动的嵌套快捷树。树结构压缩冗余尝试,利用恢复证据在不同层级调和冲突,汇总已完成分支并展开未解决分支,将已有进度与剩余义务关联。

为评估反馈质量,设计 REFIT 协议:在后置结果盲化的前提下,使用相同的初始轨迹作为源,重置环境和模型上下文,让不同模型重新尝试相同任务,比较得到的反馈。

在 Terminal-Bench 2.1 基准上,DENSE 在四个接受模型中实现了最高的严格通过率,优于所有非特权反馈方法。相较于原始执行,严格通过率提升 7.12‑15.64 个百分点,且在重跑时观察到的接受模型 token 数减少 19.0‑43.6%。GPT-5.5 的消融实验表明,嵌套子任务分析、快捷树构建和问题调和三者缺一不可。

这些结果表明,基于证据的轨迹复用能够帮助智能体自我精炼,降低对外部监督的依赖。

点评

原文链接: https://arxiv.org/abs/2609.21423

[h] 返回首页