DreamBench-SWE 是一个针对软件代理记忆卫生的多会话基准,后续软件任务需要依赖前期会话中不可推断的证据,并通过可执行的隐藏评估器进行评分。\ \ 在原始的 v2 折叠实验中,主要的 DF‑hybrid–B5 对比未出现显著差异(95/180 对 89/180;聚类 p=.518,Holm 校正后 p=1),这并不等同于等价;C9/C10 仍受 B0 余量限制。\ \ 继任的 v2.1 审计在四种条件下完成了 360/360 工作单元和 720/720 S3 单元。结果显示:外部记忆仅通过 21/180(通过率 0.1167),确定性逐字事件记忆通过 82/180(0.4556),typed‑plus‑raw 参考探针通过 83/180(0.4611),而固定托管的 Mem0 字面存储配置通过 97/180(0.5389)。预注册的六槽 Family A 保留不可用槽,p=1;对三组可用比较在 Holm 校正后全部被拒绝。两项预注册的机制对比在预评估合规性检查后不可用。二次的字面存储与逐字比较结果不具确认性且对灵敏度敏感,参考探针的比较未被拒绝。\ \ 因此,审计支持 DreamBench‑SWE 作为一个具辨别力的可执行剖面基准,并描绘出一种精确的托管记忆配置,但未能确立外部系统机制的优越性、记忆条件之间的等价性或广泛的产品通用性。原始 v2.0.5 的发现和制品保持不变。\ \ 博主点评:该基准在多会话记忆依赖场景下提供了细致的评估维度,尽管当前实验未能证明外部记忆方案的优势,但为后续研究指明了关键的对比点和评估方法。