提升大语言模型(LLM)推理能力需要高质量的数据,这类数据必须展示困难决策、相互竞争的备选方案以及其后果。合成数据质量低下和人工标注成本高导致数据稀缺。我们提出自我对弈搜索蒸馏(SPSD)框架,通过类 MuZero 网络在棋类游戏上进行自我对弈,生成超人水平的合成数据。
SPSD 利用可执行环境将搜索过程转化为结构化推理问题。在每个状态下,专家网络会给出首选决策、若干合理的备选方案、可能的对手回应以及价值估计。将这些自我对弈的搜索记录转换为超人链式思考(chain‑of‑thought),用于对 LLM 进行环境关联的监督训练。
尽管仅在自我对弈记录上进行训练,SPSD 在未见过的数学任务上仍能实现显著迁移。以 Qwen3‑4B‑Base 为例,六个数学基准的平均得分从 24.1 提升至 36.6,持出局游戏的胜率从 15% 提升至 45%。
SPSD 为生成高质量合成数据提供了一种标注高效的途径,可显著提升 LLM 在推理任务上的表现。
点评