NeFut Logo NeFut
EN 管理员登录

[AI学术] 数学推理中的链式思考形状(SHAPE)框架

发布于:2026-09-01 22:00 最后更新:2026-09-02 01:37
#Math #LLM #Artificial Intelligence

大型语言模型(LLM)在数学推理基准上表现突出,但其背后的数学意义技能尚未充分探讨。我们提出 SHAPE 框架,从数学教育的两个视角审视链式思考(CoT)轨迹:① 语义空间——模型对问题的数学解释随步骤演化(如代数、几何);② 启发式——在相应空间内采取的具体数学操作(如化简、逆向求解)。

利用 SHAPE 对多种模型的推理路径进行分析后发现,启发式的选择比传统的 CoT 特征更能解释答案正确性。此外,模型倾向于在少数语义空间内集中推理,而非遍历大量不相关空间,这一行为与人类学习规律一致。

进一步,我们检视后训练是否真正提升数学能力。结果表明,强化学习会导致模型在启发式使用上出现模式寻优,即倾向于少数高频启发式,削弱多样性。

基于此观察,我们在后训练阶段加入鼓励启发式多样性的机制,并在实验中验证了其对准确率的提升。整体而言,SHAPE 为解码 LLM 推理提供了理论依据,也指明了通过后训练提升数学推理的新路径。代码已开源:https://github.com/holi-lab/SHAPE-of-CoT

博主点评:SHAPE 将教育学的概念引入模型解释,突显了语义空间与启发式的协同作用,为后训练提供了可操作的方向,值得后续研究深入。

原文链接: https://arxiv.org/abs/2608.28600

[h] 返回首页