NeFut Logo NeFut
EN 管理员登录

[AI学术] 超越检索:长视野智能体轨迹的查询条件化重用

发布于:2026-08-14 22:00 最后更新:2026-08-16 07:03
#Machine Learning #Artificial Intelligence #Long-Horizon Agent Trajectories

检索可以识别出可能重要的过去轨迹,但它并没有指定代理如何在用户、实体、约束或环境状态发生变化后使用该轨迹。我们将此后检索的重用步骤识别为长视野轨迹记忆的一个独立瓶颈,并制定了一个评估框架,该框架在固定候选检索、目标状态、模型、解码和工具预算的同时,改变代理获得的支持。 我们使用查询条件化重用(QCR)实例化了该框架,QCR是一种故意简单的目标绑定笔记,记录了可重用过程、恢复绑定、适用性条件和验证要求。QCR的目的是测试重用假设,而不是声称一种通用首选的记忆格式。 在 WebArena、WorkArena 和 AppWorld 中的 2,391 个目标实例中,QCR 达到了 62.3% 的平均成功率,比全轨迹高出 10.7 个百分点,同时使用了 48.9% 少的在线令牌。总结重新排名选择了 94.8% 目标的可重用记忆,将最终任务成功率置于oracle可重用选择器的 1.8 个百分点之内。 轨迹长度和源-目标绑定转变的分析表明,随着轨迹的增长或源特定值的变化,直接轨迹注入会失去其大部分效用,而目标绑定支持则保留了更大份额的测量增益。 结果框架将检索质量与将检索到的经验转化为新任务的安全、有用的支持分开。 博主点评: 本文提出了一种新的框架,用于评估长视野轨迹记忆的重用步骤,并提出了一种查询条件化重用(QCR)方法,取得了较好的实验结果。这一工作对于提高智能体的记忆和重用能力具有重要意义。

原文链接: https://arxiv.org/abs/2608.12847

[h] 返回首页