大型语言模型(LLM)在长上下文任务上的表现迅速提升,这主要得益于链式思考(Chain-of-Thought,CoT)推理。然而,CoT 具体是如何帮助模型在长文本中进行计数仍不清楚。我们设计了一个“针在大海捞”(needle‑in‑a‑haystack,NIAH)计数任务:让模型统计散布在长篇文档中的记录数量。\ \ 在十二组模型对比实验中,带有思考(Thinking)步骤的模型在计数准确率上显著优于不带思考的模型(Non‑thinking),尤其在计数值较大时提升更为明显。基于此,我们展开了机制分析,发现两种截然不同的检索方式:\ \
- 广泛检索(broad retrieval):Non‑thinking 模型倾向于同时关注多个潜在的“针”,注意力分散。\
- 目标检索(targeted retrieval):Thinking 模型在 CoT 轨迹中逐步枚举,每一步只检索一个针,从而将注意力集中在单个目标上。\ \ 目标检索伴随更紧凑的内部表征——模型的隐藏状态在每次检索后会更新为更简洁的向量。进一步的因果干预实验表明,Thinking 模型利用 CoT 轨迹在检索过程中维护并更新一个内部计数器,即使没有显式的编号步骤,计数器状态仍然会随针的检索而递增。\ \ 在小规模受控实验中,我们发现这两种检索机制以及计数器状态均能在标准自回归训练下自然出现。整体结果将长上下文检索与计数的表征几何联系起来,支持了 CoT 推理是一种状态追踪(state‑tracking)过程的观点。\ \ 点评:本文通过细致的实验和因果分析,揭示了 CoT 推理在长文本计数任务中通过目标检索和紧凑表征实现性能提升,为理解 LLM 长上下文能力提供了重要的机制视角。