NeFut Logo NeFut
EN 管理员登录

[AI学术] LSREP:用于评估对话记忆的纵向状态回放协议,ICE v2 作为本地优先架构的审计案例

发布于:2026-09-16 22:00 最后更新:2026-09-18 00:46
#AI #Machine Learning #LLM

LSREP(Longitudinal State‑Replay Evaluation Protocol)通过有序回放、显式生命周期调度、重复探针、演进的参考答案以及机制保真检查,提供一种系统化评估对话记忆累积、老化和修订的方法。\ \ ICE v2 作为案例实现,是一种本地优先的记忆中间件,具备类型化存储、检索融合和动态上下文预算等特性。私有单用户实例包含 1,985 条对话轮次、219 条不同探针以及跨 52 个检查点的 1,211 条探针‑检查点观测。\ \ 在三套普通密度数据集上,ICE v2 与向量 RAG 的平均质量差异接近零,同时选择的片段减少 32%,但估计的提示 token 使用量增加 6.6%。在第四套高密度数据集上,未预算的基线出现灾难性失败。保真审计表明检索过程存在缺陷,若干机制未被触发,图结构的效用尚未确认。\ \ 在公开的匹配诊断 LongMemEval 中,ICE v2 明显落后于纯向量 RAG:证据仅 Oracle 评分为 50.8% 对 72.8%,完整评分为 43.0% 对 69.5%,配对差异分别为 -22.0 分(95% CI [-26.6, -17.4])和 -26.5 分([-31.3, -21.8])。在多会话和时间维度的严重失效中,系统表现出保守的弃答倾向。该诊断中 ICE 使用更少的上下文,展示了质量‑成本权衡而非效率优势。\ \ 综合回放、保真审计和公开端点测试,能够揭示单纯架构描述或聚合分数无法捕捉的独特失效模式。\ \ 点评

原文链接: https://arxiv.org/abs/2609.16730

[h] 返回首页