我们构建了一个包含 12,000 条两选项两难情境的数据集,覆盖三组价值冲突:诚实 vs. 正义、正义 vs. 自主、主动 vs. 诚实,并将其翻译成印地语、阿拉伯语、西班牙语和中文,以检验跨语言行为。实验在 GPT-5-mini 上进行,结果显示在未提供策略时,它在所有五种语言中始终倾向于诚实而非自主。Llama-3.2-1/3B 系列模型表现出强烈的首选项偏向,但通过普通微调或直接偏好优化(DPO)微调后,这种偏向被有效消除,准确率提升至 98% 以上。为区分数据中学习到的相关性与抽象价值本身,我们提出了任务向量转移实验:先计算对应价值偏好的任务向量,再在与通用指令遵循向量正交化后使用。实验表明,该方法能够成功分离特定价值偏好的方向,并通过任务算术得到持相反立场的模型。
点评