AI 对齐要求系统遵循人类的规范、价值或意图。在价值多元主义框架下,没有唯一正确的目标,但系统行为必须呈现一致政策:即在情境的道德相关特征保持不变时,判决保持不变;特征变化时,判决随之变化。为此我们提出四个结构性条件:判决稳定性、单调性、决定性和帕累托可行性。这些条件构成一种道德能力的度量,只需观察行为即可评估,无需引用外部道德标准或专家基准,因而提供了对齐的结构性底线而非规范性目标。
我们在三个模拟部署中检验了该方法,每个部署中 LLM 代理面临道德困境。实验采用九个前沿模型,采用五种改写、五个升级层级和三种支配条件的因子设计。结果显示,所有模型在三个部署中均未表现出一致政策:仅表层形式的改写就能导致单一升级层级下的判决率变化高达 $99$ 百分点;且模型在某一情境的成功并不能预测其在其他情境的能力。
这些发现表明,当前基于大型语言模型的代理并非适合作为对齐对象,因为它们缺乏实现连贯对齐所必需的道德能力。
点评