Chain-of-Thought(CoT)能够提升大语言模型(LLM)的推理能力,但现有优化方法主要依据最终答案的对错进行反馈,忽视了中间推理步骤的逻辑有效性。为了解决模型在逻辑错误的推理链中仍能得到正确答案的问题,本文提出 LogicTrack——一种神经符号框架,能够将每一步推理自动形式化为符号表示,并交由自动定理证明器进行验证。
LogicTrack 引入求解器驱动的回溯奖励(Solver-Based Backtracking Reward,SBR),该机制为每一步分配逻辑可靠性分数,并在推理时利用该分数指导回溯树搜索,从而在生成过程中纠正逻辑偏差。
进一步地,LogicTrack 将回溯轨迹保存为监督微调(SFT)数据,使得经过微调的模型能够内化逐步审计能力,形成对逻辑一致性的内在约束。
在 8 项推理基准和 7 种主流 LLM 上的实验表明,LogicTrack 能显著提升推理链的可验证性和最终答案的通过率,进而提高 CoT 在高风险场景下的质量与可信度。
点评