NeFut Logo NeFut
EN 管理员登录

[AI学术] 潜在链式思考推理的结构化过程监督

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #LLM

潜在推理方法通过用紧凑的连续空间嵌入取代冗长的显式链式思考(CoT)标记,提高了 token 级别的效率和鲁棒性。现有方法缺乏对这些潜在嵌入的直接过程监督,容易导致表示塌陷和信息分布不均。为此我们提出原型介导过程监督(PMPS),引入可学习的推理原型作为语义锚点,为潜在推理提供结构化的过程级监督。PMPS 将潜在嵌入和显式 CoT 嵌入投射到共享的原型空间,通过原型分配实现不等长表示之间的多对多软对齐。同时我们设计渐进顺序对齐(PSA)模块:初始阶段利用位置先验鼓励顺序对齐结构,随后逐步放宽以允许自适应匹配。实验在 GSM8K‑Aug 上显示,PMPS 将输出 token 长度压缩至显式 CoT 的 50% 以下。相较于领先基线 SIM‑CoT,平均提升 2.08% 的准确率,且在 GPT‑2 上甚至超越 CoT‑SFT。更大模型和更具挑战性的任务上,PMPS 在保持相似输出长度的前提下始终取得所有潜在推理方法中的最高准确率。

点评

原文链接: https://arxiv.org/abs/2609.09928

[h] 返回首页