大型语言模型(LLM)正从端到端的数学推理向具备代理智能的方向演进。现有的数学基准大多只评估最终答案,这种面向结果的评估难以诊断过程层面的错误,也无法衡量模型的严密逻辑,因而不足以指导 LLM 向可靠的数学代理转变。为填补这一空白,我们提出了一套过程级别的基准,用于评估 LLM 内在的代理式数学推理能力。框架首先构建了一个可复用的数学原子能力层级结构,将问题求解过程映射到规划、行动和反馈等代理行为上。随后,我们在文本和多模态两类场景中设计了完整的任务集合,涵盖从任务分解到步骤执行再到结果校验的全链路。整个基准通过自动化流水线生成高质量的解题轨迹,并利用受控的 LLM 重写技术为每一步提供细粒度的注释。实验表明,尽管不同模型在端到端准确率上相近,但它们的代理能力画像却差异显著,凸显了过程级评估在揭示模型真实潜力和推动下一代数学代理研发中的关键作用。
博主点评:这篇工作提醒我们,单看答案已远远不够,深入过程才能真正评估和提升 LLM 的数学智能。