过程记忆使语言代理能够复用成功的例程,但复用前提是存储的例程仍然适用。本文故意破坏该前提,观察其后果。研究分为两部分:一是回顾 BrowserGym TimeWarp 中的人类辅助界面适配案例;二是对合成购物决策进行冻结记忆的受控比较。
在 WebShop V1‑V6 的开发路径中,界面特定代码被改动,而单独存储的高层过程未报告变化,这一阶段并未构成自主记忆代理的评估。受控阶段的早期试点产生了一个任务,在该任务中,两种记忆条件均选择了更昂贵的商品,而无记忆条件选择了参考的最低价商品。后续探测未发现重复的行序或身份绑定模式。
随后我们测试了四种不匹配情形:数量变化、证据表示不同、局部与全局优化冲突以及分布式提升证据,共计 32 个正式单元。每个单元使用一次 temperature‑0 生成,配置相同的本地 qwen3:8b,且不进行自适应重试。跨这些配对,在当前任务证据明确且充分的情况下,预定义的干扰诊断特征均未出现。
结果表明存在一个非干扰区域:过程记忆即使与当前任务不匹配,也不一定导致行为破坏。这并不意味着普遍安全或揭示机制,仍需进一步研究哪些额外条件会将适用性不匹配转化为可观察的记忆导致错误。
点评