现代大语言模型(LLM)已经能够把自然语言描述转化为运筹学(OR)模型。现有的后训练手段,如强化学习和在线自蒸馏,进一步提升了这种能力,但仍存在三大瓶颈:
- 训练数据主要依赖人工或更强模型验证的合成公式,难以实现大规模监督。
- 奖励信号要么过于粗糙,只对完整轨迹打分,找不到具体的建模决策;要么需要额外评估器,成本高昂。
- 特权自蒸馏使用求解器上下文,而部署时往往不可得,导致风格不匹配。
本文发现模型可以利用自身 rollout 产生的求解器产物(solver‑artifact)进行自蒸馏,从而在无需外部评估器的情况下获得密集监督。基于此提出 SOLID(Solver‑Informed On‑Policy LearnIng through Self‑Distillation),其核心流程包括:
- 对同一问题进行多次 rollout,收集求解器返回的目标值和约束信息;
- 对这些目标进行聚类,选取出现次数最多的群组作为伪参考;
- 计算每个 rollout 相对于群组的优势(group‑relative advantage),并以此构造密集的自监督信号进行模型更新。
在多个 OR 基准上,SOLID 能够在仅使用结果奖励的基线上显著提升解的准确率,且对通用模型和专门调优的 OR 模型均有效。实验表明,求解器产物能够提供可扩展的自我提升路径,无需可信答案或外部评估器。
点评