NeFut Logo NeFut
EN 管理员登录

[AI学术] 何时记忆有帮助?面向工具使用LLM代理的成本感知长期记忆评估

发布于:2026-09-10 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #LLM

长期记忆在大型语言模型(LLM)代理中的价值一直通过对话回忆基准(如 LoCoMo、LongMemEval)来衡量,这类基准只关注在对话历史上回答问题,而不考察记住的事实是否会改变使用工具的行为。为了解决这一缺口,我们推出 MERIT(Memory Evaluation for Realistic Instrumented Tasks),它提供了一套可度量记忆边际效用的任务集合,并对每一次记忆操作进行代价计量。MERIT 包含三个领域的情景化工具使用任务,所有任务的前置事实依赖均通过自动泄漏检测确认;任务难度呈阶梯式递增,最高层要求对更新后的事实进行检索;我们还加入了受控的记忆损坏实验,并对每一次记忆读写进行完整的 token 与美元计量。实验在 23,440 条有评分的情节上完成(总费用 $42.57),包括一次两代的 gpt-4.1-mini 试点以及预注册的 3 种模型 × 3 次随机种子网格(GPT‑4.1、Claude Haiku 4.5,记忆侧保持不变)。结果显示,记忆能够将依赖事实的任务成功率从泄漏检测的 0.00 提升至 0.55‑1.00。对更新事实的检索表现不稳定,嵌入检索的成功率在不同模型间波动 0.30‑0.95,最大种子差 0.45;而在实际写入时,结构化事实库和 LLM 摘要两种方式的成功率均保持在 0.70‑1.00,混合使用反而不如单独使用事实库。最新一代的 Claude Sonnet 5 在干净的全回放控制下复现了相同模式。更换记忆实现方式可导致任务成功率变化最高达 60 分,而全回放从未在成本上具备优势:每个领域的最佳条件仅能提供 2.7‑3.9 倍的边际效用/美元。我们已公开基准、评测框架以及全部实验追踪数据。

点评:MERIT 通过细粒度的代价核算揭示了记忆对工具使用任务的真实价值,提供了比传统对话回忆更具实践意义的评估视角。

原文链接: https://arxiv.org/abs/2609.05441

[h] 返回首页