NeFut Logo NeFut
EN 管理员登录

[AI学术] 潜在递归LLM系统的原则性思考

发布于:2026-09-30 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

大型语言模型(LLM)可以在连续空间中进行推理,方式是对自身隐藏状态进行递归,或在多个代理之间传递这些状态。传统训练仅监督最终解码答案的交叉熵(CE),对思考过程本身没有约束。理论与实证分析表明,仅使用 CE 会导致四类失败:不同问题的思考会相互塌陷、保留无关信息、思考路径不因果、以及表示不稳定,这些都会降低正确答案的概率。

我们提出 REST(Representation‑Supervised Thoughts)训练目标,将有效思考表示的四个属性——因果性、最小性、可分离性和稳定性——转化为可微分的损失并与 CE 同时优化。REST 可直接在潜在单代理和多代理系统中实现,无需改变模型结构或在推理时增加参数。

在涵盖数学、科学、医学和代码生成的 7 项基准上,使用相同的训练数据、计算资源和潜在预算,REST 相比仅使用 CE 的训练在不同代理设置和模型规模上提升准确率最高达 $7.5\%$,并将最终答案的收敛速度提升约 $30\%$。此外,REST 生成的思考表示包含更多实现正确答案所需的信息,解码这些表示能够更好地恢复代理的预期输出,从而使潜在通信更易解释。

项目网站:https://fard-lab.github.io/REST

点评

原文链接: https://arxiv.org/abs/2609.36159

[h] 返回首页