长时程语言代理为了应对复杂环境,越来越依赖外部记忆作为冻结的世界模型。现有的记忆系统评估往往只看任务成功率或 token 消耗,忽略了记忆使用的形状。我们指出,在有限上下文和重复检索的条件下,代理的记忆会集中在少数核心状态,而把罕见状态推向长尾,导致预测误差累积。为此我们设计了保守的尾部审计(tail audit),发现记忆的核心‑尾部分布具有可复现性,但受策略影响显著。随机游走策略产生的检索分布符合对数正态分布,而语义 LLM 策略则呈现截断幂律的强核心‑弱尾特征。基于审计结果,我们提出了核心‑尾部世界模型(Core‑Tail World Model,CTWM),它是一种基于秩的记忆控制器,只用一个指数 $\tau$ 来分配提示预算,同时保留压缩的尾部信息。实验在 Synthetic Graph World 上显示,CTWM 能完整覆盖状态与转移,比图记忆基线减少 5.9% 的提示 token,并将下半部尾部预测误差降低 13.6%。在 ALFWorld 和 LongMemEval 上,同样的对比也实现了显著的 token 节省,后者在保持整体准确率不变的情况下削减了 24.48% 的 token。结果表明,重尾记忆轨迹不仅是有限检索的诊断信号,也可以作为实现 token‑高效世界模型的实用控制信号。
点评