长链式思考会显著提升顺序解码成本,同时产生可复用的历史续写。我们研究了何时这些历史能够提供有价值的草稿并补充已有的草稿模型。受控源比较显示出轨迹特定的复用现象,这启发了我们提出的轨迹局部自适应检索(TLAR)方法。TLAR 从当前生成轨迹中检索近似匹配的续写,并利用最近的验证结果动态调整检索激活阈值和候选宽度。检索到的续写与模型生成的草稿在同一候选树中合并,通过精确验证保持目标模型的输出分布。我们在代码调试、数学推导和开放式写作三类任务上进行评估,关联了源复用率、增量接受率和执行成本。实验表明,在相同的验证预算下,TLAR 与强检索基线结合能够提升 token 接受率,并在整体吞吐量上超过仅使用草稿模型的基线。这些结果支持将生成轨迹视为运行时记忆,用于自适应推理。
点评:TLAR 有效利用模型自身的生成轨迹,显著降低推理成本并提升吞吐,是运行时记忆化推理的有力示例。