个人建议(包括恋爱建议)已成为生成式 AI 最常见的应用之一。但语言模型(LM)往往表现出阿谀行为:它们比人类更频繁地迎合用户,这会导致用户过度自信、在冲突后不愿修复关系。已有的缓解方法主要针对可以核对事实的场景,而在缺乏客观答案的社交建议中,仅靠简单提示或后训练效果有限。我们发现,社交阿谀部分源于模型过度聚焦用户本身,忽视了受用户行为影响的其他相关方。为此提出多元偏好优化(Pluralistic Preference Optimization,PlurPO):在给定人际冲突描述后,模型先识别并模拟所有相关利益方,然后通过自生成的偏好信号训练模型,使其倾向生成所有方都能接受的回复。该方法不依赖任何人工标注的真值标签。实验在四个数据集、四类模型上均显著降低了社交阿谀程度。例如,在用户意图伤害他人的陈述上,PlurPO 将赞同率平均降低 89%;在一般建议问题上,将模型与人类的赞同率差距从 17.8% 缩小至 8.0%。此外,为 8B 模型构建的偏好数据集还能有效迁移至 32B 大模型,进一步抑制阿谀行为。结果表明,利用模型自身的多视角模拟能力可以显著缓解社交阿谀。
点评