后视重标记(hindsight relabeling)通过将转移的目标替换为智能体实际达到的结果,显著提升了强化学习的样本效率。将其自然扩展到偏好条件的多目标强化学习(MORL)时,常做的做法是把转移的偏好方向重新标记为智能体实际实现的方向,而不是原本请求的方向。我们在连续控制的 MO‑Gymnasium 基准上,对四种偏好条件的离线算法(涵盖两种 critic 架构和两种偏好采样策略)进行实验,发现这种扩展往往有害:在 36 种算法‑环境组合中,有 19 种表现下降,最大降幅达四个标准差,仅有一种情况出现提升,其余保持不变。
这种负面影响并非噪声重标记导致的——对目标进行去噪几乎没有恢复效果,优先采样或缓冲区结构的改变也无法消除。根本原因在于,重复的重标记使 critic 的覆盖范围收敛到智能体恰好访问的狭窄偏好子空间,我们将其称为 偏好覆盖崩溃(Preference Coverage Collapse)。为量化该现象,我们提出了放弃偏好质量(abandoned preference mass,APM)指标,它是一个价值感知统计量,能够捕捉到危害程度($\rho = -0.73$),而单纯的覆盖计数则无法检测到。
针对该问题,我们设计了 `her_mix`,它通过单一参数的凸组合,将实现的偏好方向拉回到请求的偏好方向。固定该参数在所有算法和环境中使用时,`her_mix` 能将 19 种受损设置中的 16 种恢复到基线水平,保持并进一步提升唯一受益的设置,并将放弃偏好质量从 $69\%$ 降至 $6\%$。实验表明,保护偏好单纯形上的覆盖,而非仅仅过滤噪声重标记,才是使后视重标记在 MORL 中安全可用的关键。
点评:本文系统揭示了后视重标记在多目标设置下的潜在风险,并提供了简洁有效的修正方案,对提升 MORL 的鲁棒性具有重要意义。