在多仓库库存分配中,通常将问题表述为混合整数规划(MIP)问题,但没有一种表述能够始终适应需求集中、库存失衡、补货规模、服务约束和预测波动等异构实例级别的情况。我们将此问题视为基于实例的运筹学(OR)表述选择,其中每个分配实例被分配给候选的运筹学专家库中的可执行表述。
我们提出了一种基于求解器指导的大语言模型(LLM)框架,用于运筹学表述选择,其中每个运筹学专家对应于一种编码特定分配优先级的MIP表述。为了训练选择器,该框架首先构建平衡的专家条件监督微调(SFT)记录以进行模式学习,然后利用历史实例上的MIP求解器评估,将求解器评估的分配质量差距转化为边际加权身份偏好优化(IPO)偏好和每个实例的专家得分元数据,以便在群体相对策略优化(GRPO)期间进行奖励查找。
在中国最大电商之一的京东的多仓库库存分配实例上进行的实验表明,GRPO显著提高了相较于SFT+IPO选择器的专家选择准确性,更重要的是,产生了比偏好训练选择器和最佳固定表述更高的实际分配质量。使用GRPO,Hit Ratio@1和Hit Ratio@2分别从21.45%提升至50.42%和从70.47%提升至82.31%。最终的选择器在分配准确性上相较于现有基线提高了12.57个百分点,超越了SFT+IPO选择器和最佳固定运筹学专家,同时将与后期oracle的差距缩小至4.85个百分点。
博主点评: 该研究展示了大语言模型在优化复杂运筹学问题中的潜力,通过引入求解器评估和群体相对策略优化,显著提高了库存分配的准确性。这不仅为多仓库管理提供了新的思路,也为运筹学领域的模型选择问题奠定了基础。