随着大语言模型(LLM)被用于更复杂的主观任务,如何让它们的意图和行为与人类价值观保持一致成为关键科学挑战。然而现有研究面临行为悖论:在细微措辞变化下模型表现出不可预测的“摆动”,但对纠正固有偏见的明确指令却表现出“僵硬”。解决这一二元性对可靠的AI对齐至关重要。
为系统理解并安全引导这些潜在的主观偏好,我们围绕三个基本问题展开。第一,LLM是否拥有内在价值体系?我们将106个LLM(每模型15万条查询)和95,000份人类调查数据投射到同一社会学空间,实证证明模型确实表现出价值倾向,但其分布高度集中,缺乏人类的多样性,形成理想化的价值核心。第二,如何量化这些价值?我们提出先验‑环境‑认知(PEC)框架,将价值表达定义为先验(模型参数权重)、环境(用户提示)和认知(链式思考)三者的联合结果。第三,如何将LLM的价值对齐到目标?基于PEC诊断,我们设计自适应“对齐处方”,不再盲目进行高成本训练,而是针对每个维度识别最小有效干预,从零成本提示到有针对性的参数更新。大量实验表明,该方法能够验证LLM价值的存在,精确量化其变化,并在不削弱通用能力的前提下,实现比传统盲训练更高效、更精准的价值引导。
点评