大型语言模型(LLM)因能够生成可读的推理过程而被引入交通信号控制(TSC)作为决策代理。现有方法仅依据最终奖励优化,无法区分有效与错误的推理步骤,导致有用和误导的步骤被同等更新,削弱了模型的推理学习。
为解决此问题,本文提出 ProcessLight 框架,将信号决策拆解为可验证的语义步骤。基于 ProcessLight,进一步设计了逐步交通过程策略优化(STeP‑PO)框架,使用强化学习在步骤层面进行信用分配。STeP‑PO 通过步骤质量得分评估局部推理质量,利用步骤重要性衡量每一步对最终动作的影响,并在语义步骤树上计算步骤优势。随后将步骤优势传播到推理 token,实现超越仅结果奖励的细粒度策略优化。
实验在多个真实数据集上进行,结果显示所提方法在收敛速度和控制性能上均优于基线。代码已开源:https://github.com/wenzhaoabc/processlight。
点评