NeFut Logo NeFut
EN 管理员登录

[AI学术] 颠覆逻辑推理的全新方法:SymStep 符号步骤验证

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#algorithm #AI #Machine Learning

摘要

Chain-of-thought (CoT) 提示在约束密集的逻辑推理任务中表现不佳,错误会在步骤中悄然积累。我们提出了 SymStep:一种使大型语言模型(LLM)一次性进行原子声明的方法(例如:推导:Alice, pet, Cat),然后使用轻量级约束传播器检查该声明与先前接受的推导的一致性,拒绝矛盾,并自动级联隐含事实。

SymStep+G 进一步在每个接受的步骤后提供 MRV 指导,指引 LLM 朝向最约束的未解决变量。在 ZebraLogicBench 的 35 道保留子集上(包含 1000 道爱因斯坦风格的逻辑谜题),直接方法和 CoT 均达到 0%,而 SymStep+G 则高达 97%。在 AR-LSAT 分析推理问题上,SymStep 达到 100%,而 CoT 为 87%。在 LGP-14 上,SymStep+G 达到 100%,而 CoT 和 Logic-LM(我们比较的最强符号+LLM 基线)均为 0%。

消融研究表明,MRV 指导是减少无方向循环的关键机制,而一致性检查为显式矛盾提供了安全网。在跨越五个任务领域的六个基准测试中,SymStep 变种在约束密集和算术任务上与每个基线相匹配或超越。对 AQUA-RAT 代数的实验确认了这一优势是特定于约束密度的。

博主点评: SymStep 在逻辑推理领域的突破性进展展示了符号推理与语言模型结合的巨大潜力。通过引入 MRV 指导和一致性检查,SymStep 不仅提升了推理的准确性,也为复杂逻辑任务提供了新的处理思路,值得在未来的研究中深入探索。

原文链接: https://arxiv.org/abs/2607.23055

[h] 返回首页