NeFut Logo NeFut
EN 管理员登录

[AI学术] 向量能容纳多少思考?叠加推理的容量

发布于:2026-09-15 22:00 最后更新:2026-09-16 00:22
#AI #Machine Learning #LLM

大语言模型通过多步推理的中间计算解决复杂问题。传统链式思考把这些计算序列化为 token。最近的连续/循环方法把部分计算压入固定维度的潜在状态,允许一个“思考”叠加多个备选。\ \ 关键设计问题是:在推理过程中,连续思考应保留什么信息?直观做法是只保留当前推理前沿,丢弃过去计算,认为保存更多会稀释状态、浪费有限的表示容量。\ \ 我们证明直觉并不总成立。若下游计算相同,累计叠加保留完整推理历史在所需表示维度上可以低于仅保留前沿的叠加。固定隐藏宽度下,这种优势让潜在推理器能够保留更多有效证据、区分更多合理的下游结果,并推迟压缩状态失效的时刻。\ \ 这种反直觉现象来源于:有信息的历史成分会相干强化,而无关备选会产生随机干扰。该视角也回答了实际设计问题:当未来使用未知时,模型应如何加权潜在状态中累积的记忆?在可重用的加权叠加中,优先少数近期或显著项会导致记忆表征薄弱,成为后续注意的瓶颈。均匀的累计加权避免此缺陷,并且我们证明它在鲁棒未来推理下是极小极大最优的。\ \ 因此,叠加不再是潜在空间的副现象,而是设计原则:平衡的累计记忆让固定的表示预算支持更可靠、可重用的计算。\ \ 点评:总体来看,累计叠加在保持历史信息方面提供了意想不到的优势,为大模型的潜在推理设计提供了新的方向。

原文链接: https://arxiv.org/abs/2609.13747

[h] 返回首页