公平分配稀缺且不可分割的资源是许多社会问题中的核心挑战。已有多种形式化的公平理论,但没有一种定义能够在所有情境下同时满足。随着大语言模型(LLM)被越来越多地用于支持决策并充当代理人,它们带来了新的分配正义担忧:模型的判断并未直接对应任何特定的公平框架,可能会违背关键的规范原则。
本文提出了一种通用的方法来评估LLM的公平推理能力。我们在大量模型上收集第一人称的公平判断,并在相同情境和信息获取条件下直接与人类响应进行对比。实验结果显示:LLM倾向于采用比人类更严格的公平约束;在资源竞争情境中表现出更强的自利行为;对信息呈现方式(框架)高度敏感;而使用当前公开数据集进行微调难以将模型的判断对齐到人类水平。
这些发现表明,单纯的微调并不足以解决LLM在资源分配中的公平对齐问题,需要更系统的评估与校准机制。
点评