个性化大语言模型(LLM)需要将生成行为与用户的特定偏好对齐,而不是仅追求整体质量。直接偏好优化(DPO)提供了一个稳定的偏好学习框架,但在个性化场景下,其效果高度依赖于偏好配对的选择方式。现有方法多基于似然极端等启发式准则,这会把优化过程与用户效用脱钩,导致个性化性能下降。\
我们将个性化偏好学习形式化为几何对齐的优化问题,分析期望用户效用梯度与 DPO 更新方向的一阶交互。结果表明,在离线采样条件下,当偏好间距的方向与效用梯度对齐时,DPO 更新从纯粹的误差校正信号转变为类似强化学习的更新。这一视角将配对选择视为几何决策,决定了偏好优化是推动还是阻碍个性化。\
基于此洞见,我们提出 GAP‑DPO(Geometry‑Aligned Preference DPO),其核心是迭代式的效用感知、几何对齐配对选择,并通过逐 epoch 再生成控制分布漂移。实验在多个个性化文本生成基准上进行,结果显示 GAP‑DPO 在风格忠实度、偏好对齐度和生成质量上均优于标准 DPO 变体。\
综上,梯度对齐提供了统一的个性化偏好优化原理,配对选择不再是预处理的启发式步骤,而是优化几何的内在组成部分。\
点评