NeFut Logo NeFut
EN 管理员登录

[AI学术] 四阶段分解词题求解及LLM数学推理的机制脆弱性

发布于:2026-09-17 22:00 最后更新:2026-09-18 00:46
#AI #Math #LLM

大型语言模型(LLM)在解答小学数学文字题时能够达到很高的准确率,但只要在题目中插入一个无关的子句,模型的解答往往会全部崩溃。我们通过机制层面的分析,将模型内部的计算过程划分为四个连续阶段:

  1. 模式抽象(Schema Abstraction)——模型在低层网络中提取题目的结构模板。
  2. 操作规划(Operation Planning)——在中层注意力头中决定应执行的算术操作序列。
  3. 操作数绑定(Operand Binding)——在更高层将具体数值与前一步规划的操作对应起来。
  4. 计算执行(Computation)——在顶层层块完成实际的数值运算并生成答案。

每个阶段都会在特定的层带产生可辨识的中间表示。利用相同的分析框架,我们进一步检查了干扰子句导致的失败。实验表明,干扰只会破坏操作规划阶段的表示,而其他阶段保持完整。该阶段由一组注意力头实现,我们通过双向因果干预(插入/抑制)验证了这些头的决定性作用。

综上,我们提供了对LLM解答数学文字题的机制解释,并揭示了其在受到无关信息干扰时的脆弱点。

点评

原文链接: https://arxiv.org/abs/2609.17804

[h] 返回首页