NeFut Logo NeFut
EN 管理员登录

[AI学术] ERRAND:预算化的代理记忆维护

发布于:2026-09-25 22:00 最后更新:2026-09-28 00:49
#algorithm #AI #Machine Learning

部署的智能体在交接的知识上运行:冻结的策略只会查询在流开始前写好的汇总条目。随后世界在变化,而存储保持不变:路径关闭、标志改变、价格区间移动;每个条目在交接时都是真实的,失败来源于陈旧而非无知。

我们提出 ERRAND,将重新验证视为有价的差事:一次重新检查与它所保护的任务争夺同样稀缺的动作,仅在解决疑惑的每动作价值超过运行工资时才提供资金。差事指数呈单峰形,在信念两端趋于零,因此向任一方向的确定性不产生费用;沿路的免费收据保持路径知识,修复操作写入新版本,从不删除。

在两个漂移的工具使用世界中,若动作预算相等,ERRAND 在预注册的标度上清除所有非 oracle 策略,在每种设置中都是主要策略,并在每个绑定预算下表现为条件性,使得在基础上限下,积极的重新验证提升 10.0pp。

约束获胜:在没有上限的情况下,ERRAND 会自行停止,仅消耗 11.0% 的步骤,而无限制的积极重新验证消耗 70.7% 步骤,仍比受限的 ERRAND 落后 4.5pp。差距出现在简报覆盖最薄弱的区域,即长尾知识的影子价格:小预算、合理定价胜过永不重新检查的大存储。

点评

原文链接: https://arxiv.org/abs/2609.29545

[h] 返回首页