NeFut Logo NeFut
EN 管理员登录

[AI学术] 共享代理记忆中的认知准入基准与诊断研究

发布于:2026-09-28 22:00 最后更新:2026-09-30 01:41
#algorithm #AI #Machine Learning

评估共享代理记忆中的认知准入十分困难,因为同一主张的多次出现可能被误认为是独立证据。代理可以直接复制检索到的信念,也可以改写后再写入;如果错误主张被准入,后续代理将被误导。为此我们提出了相关提升基准(Correlated Promotion Benchmark,CPB),用于判断候选主张是否应写入共享记忆。\ \ CPB 包含两种设置。CPB-Static 从公开标注数据中冻结出测试集,并提供固定的金标准动作。CPB-Live 让多代理团队在同一存储上运行,记录所有写入与检索,并依据每个场景追踪来源血缘。另设一个仅从存储读取的消费者,用于评估记忆本身的答案质量。\ \ 我们在四类代理(四个家族)上测试了八种准入策略。实验结果显示,去重来源的策略会同时拒绝大量真实主张和错误主张;而强调答案覆盖的策略几乎和不加限制的共享一样,接受了大量错误主张。对声明的来源类型进行门控可以将错误采纳率降低到 $0.06$--$0.09$,而其他回答策略的错误采纳率在 $0.22$--$0.47$ 之间。\ \ 一旦未经争议的错误信念进入记忆,消费者在 $0.97$--$0.99$ 的探测中会直接断言该错误,且在所有代理家族中表现一致。没有任何非 oracle 策略能够在逐字复制、改写以及声明为权威的改写三种情况下始终拒绝错误主张。这表明在缺乏来源血缘信息的情况下,准入策略的效果受到根本限制。\ \ 点评

原文链接: https://arxiv.org/abs/2609.30813

[h] 返回首页