NeFut Logo NeFut
EN 管理员登录

[AI学术] 超越验证答案:基于求解器反馈的自蒸馏用于提升运筹学语言模型

发布于:2026-09-13 22:00 最后更新:2026-09-15 01:15
#AI #Machine Learning #LLM

现代大语言模型(LLM)已经能够把自然语言描述转化为运筹学(OR)模型。现有的后训练手段,如强化学习和在线自蒸馏,进一步提升了这种能力,但仍存在三大瓶颈:

  1. 训练数据主要依赖人工或更强模型验证的合成公式,难以实现大规模监督。
  2. 奖励信号要么过于粗糙,只对完整轨迹打分,找不到具体的建模决策;要么需要额外评估器,成本高昂。
  3. 特权自蒸馏使用求解器上下文,而部署时往往不可得,导致风格不匹配。

本文发现模型可以利用自身 rollout 产生的求解器产物(solver‑artifact)进行自蒸馏,从而在无需外部评估器的情况下获得密集监督。基于此提出 SOLID(Solver‑Informed On‑Policy LearnIng through Self‑Distillation),其核心流程包括:

在多个 OR 基准上,SOLID 能够在仅使用结果奖励的基线上显著提升解的准确率,且对通用模型和专门调优的 OR 模型均有效。实验表明,求解器产物能够提供可扩展的自我提升路径,无需可信答案或外部评估器。

点评

原文链接: https://arxiv.org/abs/2609.09957

[h] 返回首页