Memory 与 RAG 评估常把模型的输入视作实现细节,忽视了同一段历史可以以记忆条目、摘要、结构化记录或原始摘录等不同形式呈现给读者。为此我们提出 RENDER 基准控制,它在保持对话内容不变的前提下,系统性地切换面向读者的呈现方式。
RENDER 采用五层 "packet ladder",明确答案所在内容何时进入模型输入;同时提供四种确定性模板:ChatGPT 风格的条目、LangChain 摘要、MemGPT 风格的结构化记录以及原始对话。我们在 500 条 LongMemEval 题目上,使用九种模型进行实验。结果显示,在相同预算下,经过 "packet" 处理的答案比仅截取最近对话的原始对话提升了 42.4–72.6 分。在部署式模板中,同一模型的最佳‑最差差距为 24.6–48.8 分;在主要评分器下,ChatGPT 风格的条目在 9 个模型中有 7 个表现优于原始对话。
重新评分的裁判仍保留了整体正向提升,但对单模型的显著性呈现混合趋势。值得注意的是,三种模型在正式账本式 "packet" 上得分为 0,却能在自然语言条目上以 45.4–53.4% 的准确率回答相同事实。该效应在检索噪声下仍然稳健,并迁移至 HotpotQA 数据集,表明记忆/RAG 评估应当报告或控制面向读者的呈现形式。
博主点评:RENDER 揭示了评估框架中隐藏的呈现偏差,提醒研究者在设计记忆或检索任务时,必须明确记录读者看到的内容形式,否则可能低估模型真实的记忆能力。