大型语言模型(LLM)在解答小学数学文字题时能够达到很高的准确率,但只要在题目中插入一个无关的子句,模型的解答往往会全部崩溃。我们通过机制层面的分析,将模型内部的计算过程划分为四个连续阶段:
- 模式抽象(Schema Abstraction)——模型在低层网络中提取题目的结构模板。
- 操作规划(Operation Planning)——在中层注意力头中决定应执行的算术操作序列。
- 操作数绑定(Operand Binding)——在更高层将具体数值与前一步规划的操作对应起来。
- 计算执行(Computation)——在顶层层块完成实际的数值运算并生成答案。
每个阶段都会在特定的层带产生可辨识的中间表示。利用相同的分析框架,我们进一步检查了干扰子句导致的失败。实验表明,干扰只会破坏操作规划阶段的表示,而其他阶段保持完整。该阶段由一组注意力头实现,我们通过双向因果干预(插入/抑制)验证了这些头的决定性作用。
综上,我们提供了对LLM解答数学文字题的机制解释,并揭示了其在受到无关信息干扰时的脆弱点。
点评