在为大语言模型(LLM)挑选数学训练数据时,常见的组织原则是按主题划分,例如为概率目标准备概率例题。另一种思路是按推理方式划分,即选取与目标使用相同解题方法的例题,即使数学领域不同。我们比较这两种匹配方式在微调后的迁移效果。实验采用两套互补的 $2\times2$ 设计:第一套交叉概率与组合学,分别配合不变推理和双计数,共 2000 题;第二套交叉数论与几何,分别配合补集与鸽巢推理,共 800 题。每个单元格轮流作为保留的目标任务:相同方法(SA)来源保持目标的解法但更换主题;相同主题(ST)来源保持主题但更换方法。所有来源在两种角色中各出现一次,保证加权对比时源质量的影响相互抵消。跨五个基础模型、每种设计三组训练随机种子,SA 在全部 40 组模型‑目标比较中均优于 ST。模型层面的提升在主设计中为 8.2%~16.2%(平均 10.8%),在第二设计中为 12.0%~16.0%(平均 14.3%),所有十组 95% 置信区间均不包含零。值得注意的是,ST 在嵌入相似度和词汇相似度上更接近目标,但 SA 的优势却与这些表层相似度呈相反趋势。结果表明,在所考察的主题‑方法组合中,推理方式是比主题更有效的匹配准则。
点评:本研究提供了系统实验证据,支持在数学微调中优先考虑解题思路而非学科划分,可为构建更高效的数学 LLM 数据集提供指导。