NeFut Logo NeFut
EN 管理员登录

[AI学术] 学习异质偏好

发布于:2026-09-17 22:00 最后更新:2026-09-18 00:46
#AI #Machine Learning #LLM

从人类反馈中学习已成为训练现代 AI 系统的核心范式,模型通过将人类效用函数作为奖励模型来进行策略学习。传统方法假设整个群体共享一个\emph{通用效用}函数,并把标注者之间的分歧视作随机波动。这在客观任务中尚可,但在主观领域会失效,因为不同个体的偏好会系统性地出现差异。

本文聚焦于主观偏好学习,假设观察到的选择来源于一组异质但内部一致的效用函数。借鉴理性选择理论(RCT)\cite{tversky1981framing},我们提出\emph{个体化效用}函数,它同时以个体身份和决策情境为条件,并设计了一种多阶段架构,从多模态数据中估计这些函数。

我们在新收集的包含 $575{,}000$ 对美学判断、$2{,}398$ 名参与者比较汽车轮毂设计的数据集上进行评估。实验表明,个体化效用模型显著优于通用效用模型,包括基于大模型的基线。结果证明,标注者之间的分歧反映了真实的偏好异质性,而非噪声。

更广泛地说,这一工作强调了收集标注者属性并学习个体化效用函数的重要性,使奖励模型能够明确表示其所代表的偏好主体,并忠实捕捉人类决策的多样性。

点评

原文链接: https://arxiv.org/abs/2609.17847

[h] 返回首页