NeFut Logo NeFut
EN 管理员登录

[AI学术] TWIST:对话记忆干预质量的基准及人类验证草稿对齐

发布于:2026-09-25 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

长对话记忆基准越来越关注回忆和知识更新,近期工作研究用户信念和记忆状态的演变。TWIST 提出评估未被测量的属性——干预质量,即记忆系统在信念变化点是否能正确介入。

四个轨道分别是:未提示的紧张检测、对输出草稿与记录进行审查、在保持取代历史的同时用当前信念回答、以及对敏感回忆的治理。套件基于 LoCoMo 语料和工具,每个检测/阻断指标都有对应的“不要过度检测”对照:表面匹配的硬负例用于惩罚误干预,防止通过标记所有内容来作弊。

基准本身通过独立的盲标注、仲裁、评委诱饵校准和可分离性审计进行验证。Track B v1.0(161 条,仲裁后 κ=0.85)的人类验证结果显示,没有任何配置同时实现高矛盾召回、高硬负例特异度和高归因。

平坦的 RAG 基线能够召回 0.76‑0.97 的真实矛盾,但会错误标记 16‑43% 的表面匹配安全草稿;而部署的面向连贯性的系统几乎不误标(特异度 0.98‑1.00),但只捕获 42% 的真实矛盾——这是仅靠召回分数看不到的权衡。

13 种配置的基线梯度揭示原因:每个金标准矛盾仅凭证据即可检测到(召回 1.000),在完整转录下校准模型几乎解决该轨道,说明检索覆盖存在显著缺口;仅使用草稿的底线显示模型风格先验的影响。

系统的 TWIST 概况除了召回分数,还衡量记忆何时应当干预、何时不应干预。

点评: TWIST 为评估对话记忆系统的实际可用性提供了细粒度视角,强调了误干预成本与真实干预收益的平衡。

原文链接: https://arxiv.org/abs/2609.28575

[h] 返回首页