大型语言模型(LLM)能够把业务描述转化为优化模型,但生成的可执行代码可能会误写约束或目标,导致求解器给出错误问题的最优解。即使解满足表面规则,仍可能存在更优方案。针对经常使用优化建模的组织,本文提出一种低成本、可本地部署的LLM框架,要求能够自动验证并改进模型表述。
我们设计了 OSCAR(Optimization modeling by Simulator, Coder, And Reviewer),核心是离线 Simulator,它通过已标记的可行/不可行决策样本进行认证,用来比较不同模型的输出并在可行性之外继续搜索改进。Coder 负责调用不同的 LLM 生成模型代码,Reviewer 根据 Simulator 的标签判断其是否符合业务规则。
在每一次改进尝试中,需要决定:
- 调用哪种 LLM(价格与能力不同);
- 何时停止搜索。我们把这看作在未知难度下的序列决策问题。若先验已知,证明按成本递增的升级顺序是最优策略;在一般情况下,给出先验无关的竞争性上界。
实验在五个基准问题上进行。使用两种小型开源权重 LLM(均可在单 GPU 本地部署),OSCAR 在报告的设置下实现 95%~100% 的准确率,而单次调用的准确率分别为 29% 和 48%。在每个问题的五次运行中,Codex 与 Claude Code 的平均 token 消耗分别是 OSCAR 的 3.1 倍和 5.8 倍。
OSCAR 既支持本地模型,也可根据预算和保密需求切换到云端。企业应维护标记的可行/不可行决策样本,以明确自然语言的业务规则。当 LLM 的解释与这些标签冲突时,OSCAR 会遵循标签进行纠正。随着模型能力和价格的变化,OSCAR 的简单运行规则和可调参数帮助企业灵活调整模型选择,持续受益。
点评