人们的价值观多样且常常冲突,单一的对齐模型难以满足所有人。因此,多元对齐需要可调节的模型,以不同方式平衡竞争目标。Multi-Objective Direct Preference Optimization(MODPO)通过引入目标权重,实现一条连续的权衡曲线。
本文聚焦两个问题:一是何时同一模型能够同时提升两个目标;二是如何在不为每个权衡单独训练模型的情况下覆盖更多的权衡空间。我们在 HelpSteer 与 UltraFeedback 的七对目标上进行实验。结果显示,两个预训练阶段的度量能够预测在人类标注数据上目标是对齐还是冲突,但在 AI 标注数据上失效,原因在于回复长度和重复度对奖励模型分数的干扰。
为实现更广的权衡覆盖,我们尝试了最近邻已训练模型的选择以及模型参数的合并两种策略。两者均能在一定程度上提升覆盖度,但仍未能稳定匹配直接针对特定权衡进行训练的效果。
这些发现为构建能够服务多样化偏好的可调模型提供了实用指南。
点评