NeFut Logo NeFut
EN 管理员登录

[AI学术] 从静态个人价值到情境化个性化:面向LLM的贝叶斯个人价值对齐

发布于:2026-09-25 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

个性化价值对齐在大语言模型(LLM)需要满足多元用户偏好的背景下日益重要。现有方法往往在所有提示上使用固定的价值画像,忽视了不同情境下价值维度的重要性差异。受Lewin场论启发,我们将个人价值视为先验,将情境依赖的偏好视为后验。

我们提出 BaCVA——一种推理时的贝叶斯情境感知个性化价值对齐方法。它通过将静态个人价值与场景特定的价值显著性相结合,近似后验个性化偏好。具体步骤包括:① 从一般规范性回答中估计情境价值显著性;② 使用双视角个性化模块,从个人价值视角和情境驱动视角分别推断后验偏好。贝叶斯公式可表述为 $$P(\text{偏好}\mid\text{情境}) \propto P(\text{偏好}) \times P(\text{情境}\mid\text{偏好})$$,其中先验 $P(\text{偏好})$ 来自用户的静态价值,似然 $P(\text{情境}\mid\text{偏好})$ 由情境显著性提供。

该框架在推理阶段即可实现自适应对齐,提高了对不同情境的响应准确性,并通过先验价值提升了数据效率。大量基准实验表明 BaCVA 在多个指标上均优于强基线。

点评

原文链接: https://arxiv.org/abs/2609.28942

[h] 返回首页