大邻域搜索(LNS)依赖于 destroy 与 repair 两类算子,算子的效果取决于对 LNS 状态的适应以及两者的交互。我们提出 Stackelberg 程序优化(SPO),一种基于大模型的框架,用于自动发现可执行的自适应 destroy‑repair 程序。SPO 将算子决策条件化为紧凑的 LNS 状态,使得状态依赖行为能够在程序发现过程中自然出现,并将 destroy 与 repair 的发现建模为程序空间中的 Stackelberg 交互,体现它们的非对称依赖关系。角色专属的信用机制把 destroy 程序视为领袖,repair 程序视为条件追随者,从而在耦合优化过程中同时引导大模型生成器学习和基于种群的演化搜索。实验在旅行商问题和容量受限车辆路径问题上进行,结果显示 SPO 在多种设置下均优于强基线,并且能够推广到更大规模实例和不同基准集。行为分析进一步表明,发现的算子表现出明显的状态依赖特性,并在发现过程中实现了 destroy 与 repair 的协同提升。
点评