数学推理基准通常按主题划分,但语言模型内部可能更倾向于按可复用的推理方法组织。本文探讨开放的具备数学能力的 LLM 是按子技能主题还是按推理方法进行内部组织,并提供证据表明方法才是关键。
我们提出一种 生成‑回放协议:模型先生成解答,然后我们在相同的提示‑生成轨迹上回放,提取每个推理 token 的激活重要性签名。对八种模型和五个数学推理来源的签名进行无监督聚类,并通过结构、语义和干预测试评估聚类质量。
在全部 40 个模型‑来源组合中,得到的聚类均显著优于等大小的随机基线。两位独立的前沿 LLM 评审员发现,真实聚类在 77‑82% 的情况下呈现出方法层面的连贯性,而同源对照仅为 6‑11%。纯主题聚类往往被标记为比主题更细的推理方法。
在受方法控制的提示实验中,改变所请求的推理方法会在八个模型条件中的七个导致聚类重新分配;而仅改写提示的同义句则基本保持原有聚类。这表明具备数学能力的 LLM 在内部计算时更依赖推理方法而非基准主题。
意义:即使基准按主题分层或训练语料在主题上保持平衡,也可能在推理方法维度上出现严重不平衡。未来的评估与数据构建应关注方法多样性,以避免隐藏的偏差。
点评