偏好驱动的对齐方法通常只针对单一偏好模型进行优化,这会导致在偏好对偶出现噪声、异质或部署后变化时表现脆弱。为了解决这些问题,我们提出了鲁棒纳什对齐,这是一种针对不确定对偶偏好的博弈论框架。核心学习者在该框架中寻找一种策略,使其在最坏情况下相对于对手以及任意位于名义偏好周围模糊集合中的偏好核都拥有最大的胜率。模糊集合捕获了偏好的不确定性,因而游戏的鲁棒目标直接提供了最坏情况性能的认证下界。该优化问题在计算上极具挑战。为此我们构造了一个四方玩家的原始-对偶代理博弈,参与者分别是领袖策略、跟随者策略、对抗性偏好核以及对偶变量,并基于单循环的乐观镜像下降上升算法进行求解。我们证明代理始终下界截断的硬约束目标,给出代理与硬约束之间的差距,并给出在何种条件下代理能够完全恢复鲁棒目标的精确性条件。进一步我们证明了代理博弈的对偶间隙以 $\mathcal{O}(1/\sqrt{T})$ 的速率在平均迭代上收敛,这意味着可以得到原始鲁棒目标的近似最优策略。实验在受控的表格游戏以及存在不确定偏好的大语言模型对齐任务上验证了收敛理论,并展示了相较于名义基线的性能提升。
点评