摘要
连续思维链(CoT)方法用短小的密集潜在表示替代了冗长的推理轨迹。早期的连续 CoT 方法间接地监督潜在表示,使其最终状态与冗长的推理轨迹匹配,这在训练期间需要自回归的、缓慢的生成。
我们引入了 C-MTP,一种更简单、更快速的直接监督方法,模型将每个潜在表示视为待压缩的 CoT 轨迹中嵌入的平均值。我们的方案在性能上优于先前基于直接监督的近似压缩令牌分布的方法,并在现有的简化 CoT 轨迹(少于 100 个令牌)评估环境中与较慢的间接监督方法表现竞争。
最后,我们将连续 CoT 方法的评估扩展到具有更复杂任务和更长推理轨迹($\ge$几百个推理令牌)。我们发现,在这种设置下,直接和间接监督训练方法的表现均较差(大约 65\% 的性能下降),揭示了当前连续 CoT 方法的局限性。
代码和检查点已发布在 GitHub。
博主点评: C-MTP 方法在速度与效率上都表现出色,但在复杂任务中的显著性能下降,提醒我们在追求模型简化的同时,必须关注其适应性与通用性,这是未来研究的关键方向。