NeFut Logo NeFut
EN 管理员登录

[AI学术] 错误上下文中的正确记忆:验证长期代理记忆的检索可接受性

发布于:2026-10-07 22:00 最后更新:2026-10-08 01:25
#AI #Machine Learning #LLM

长期记忆代理在检索时可能返回属于其他主体、违反策略或处于不兼容生命周期状态的信息,这类信息对当前请求是不可接受的。仅凭召回率和最终答案的准确率无法发现此类违规,因为路径可能缺少必要证据而看似安全,或者正确答案却基于不可接受的提示暴露。为此我们提出检索可接受性验证框架,对每个记忆‑查询对标记为可接受、不可接受或未决三种状态。框架在匹配的必需证据召回上比较不同路径,对未决情况给出上界下界,并在提示暴露过程中追踪记忆 ID,将暴露关联到目标层面的信息泄露。我们在互不重叠的独立人群上评估框架的各阶段。对两个公开长期记忆基准 RHELM 与 MemOps 的冻结排名进行后置 Top‑20 重分析,覆盖 3,767 条查询。所有已发布的锚点均位于可信查询命名空间;在命名空间内部得分保持不变,跨命名空间过滤不会降低其排名。Top‑20 锚点召回率从 0.432 提升至 0.533,80% 召回可行性从 0.237 提升至 0.311,精确相似度评估下降 98.3%。在冻结的 72 案例开发诊断中,使用已发布的元数据参考能够保留必需证据,而仅文本验证器在 1% 必要锚点误拒限度下未能检测到违规。跨 1,523 对基准原生案例,命名空间路由与判定准确率提升 0.053‑0.068(三种阅读器),召回率亦随之变化,故该比较为观察性。16 场受控暴露实验中,仅有四个阅读器中的一个 95% 置信区间不包含零,显示相关不可接受文字泄露的提升为 +0.156,置信区间 [0.031, 0.312]。结果表明需要对候选支持、可接受性、提示暴露和答案泄露分别进行验证。

点评

原文链接: https://arxiv.org/abs/2610.07309

[h] 返回首页