本文介绍了一种利用语言模型(LLM)进行语义站点嵌入的强化学习方法,以解决公交车列车群集问题。传统的强化学习控制器主要依赖于瞬时操作变量或路线特定的站点标识符,但这些信息对于理解个别站点的功能和操作环境是有限的。本研究使用LLM对异构的站点信息(包括物理属性、周围活动环境和历史操作特征)进行离线转换,得到固定语义嵌入,然后将其集成到深度Q学习控制器中。实验结果表明,语义控制器相比于Daganzo基线,能够减少行头变异性、车群事件和乘客等待时间分别为32.0%、69.2%和24.0%。此外,语义站点信息能够改善行头规律性、等待时间和控制努力,提供了更好的整体权衡。实验还表明,零样本迁移提供了有限的即时泛化,而预热后的微调能够加速早期学习和改进迁移策略。这些发现表明,语义状态表示可以补充传统的操作状态,并支持基于适应的策略在相关路线之间的重用。 博主点评: 本文提出了一种创新的解决公交车列车群集问题的方法,利用LLM进行语义站点嵌入,并将其应用于强化学习控制器中。实验结果表明,该方法能够有效地减少车群事件和乘客等待时间,具有良好的实用价值和研究意义。