摘要
多任务神经求解器旨在处理多种车辆调度问题(VRP)变体,以统一模型避免为每个约束组合单独训练。然而,VRP变体在优化难度上存在差异,而现有方法在训练状态上缺乏阶段性反馈,导致模型偏向于某些特定变体。尽管元学习可以支持自适应训练,但通常需要双层优化和额外的梯度更新,从而增加了计算成本。
为了解决这一限制,我们提出了LLM-as-Trainer(LaT),一种即插即用的训练范式,利用预训练的大型语言模型作为外部训练器。LaT定期分析跨任务的验证指标,以生成阶段性指导向量。该向量与当前任务的约束向量结合,并注入到每个编码器层中,为神经求解器在后续策略优化过程中提供额外的训练信息。
在16个VRP变体上的实验表明,LaT提高了多种最先进的多任务神经求解器在训练和未见变体上的解决方案质量,支持了所提训练范式的有效性和普适性。
博主点评: LaT的提出为多任务优化问题提供了一种新思路,通过结合语言模型的能力,显著优化了训练过程,值得在实际应用中进一步探索其潜力。其阶段性反馈机制也为其他领域的模型训练提供了重要参考。