在推理模型的自我提升过程中,使用自身的 on‑policy 经验可以带来显著收益,但该循环极其脆弱。终止验证器(verifier)提供可靠却稀疏的监督,而同模型的密集引导往往会强化错误的置信或把学习局限在单一解法上。
FlowBalance 通过学习一个归一化的完整响应分布来缓解上述问题。对于每条 on‑policy 轨迹,冻结的训练时视图(frozen view)利用特权上下文计算每个 token 的对数概率增益 $\Delta\log p_t$,并将其累计得到轨迹级的自我引导得分 $G(\tau)$:
$$G(\tau)=\sum_{t=1}^{|\tau|}\Delta\log p_t$$
随后,利用验证器得到的组优势(group advantage)$A_g$ 对该得分进行校准:正优势轨迹保留原得分,负优势轨迹取相反符号,无优势时关闭引导。校准后的得分转化为能量函数 $E(\tau)= -A_g\,G(\tau)$,并以指数形式重新加权参考策略 $\pi_{ref}$:
$$\pi_{new}(\tau) \propto \pi_{ref}(\tau)\,e^{-E(\tau)}$$
对每个 rollout 组,仅需估计一次对数分区函数 $\log Z_g$,即可通过轨迹平衡(trajectory balance)使归一化目标分布得到匹配。该过程不再需要额外的 token 级模仿损失。
理论分析表明:
- 组内对比得以保留;
- 最小变化的逆 KL 表征得到实现;
- 验证器对目标奖励的单调控制成立;
- 对被拒响应的误导性自我引导提供了精确校正。
在数学推理基准上,FlowBalance 相比 FlowRL 在 Qwen3‑4B 与 Qwen3‑8B 上均提升了平均表现;训练速度更快、稳定性更好,避免了直接 OPSD 方法出现的响应长度崩塌;在受控的 AIME24 诊断中展现出更高的正确策略多样性。
点评:FlowBalance 通过验证器引导的能量重加权,实现了稀疏可靠监督与密集自我引导的有效融合,既提升了模型的推理能力,又保持了训练的稳健性。