NeFut Logo NeFut
EN 管理员登录

[AI学术] 超越对错:评估大语言模型的二阶社会推理

发布于:2026-09-10 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #Artificial Intelligence

先前的 AI 对齐工作主要聚焦于一阶社会规范——教模型哪些行为是被接受的、哪些是被禁止的(例如“不要偷窃”)。然而,真正的社会智能不仅需要识别规范,还要预测谁会执行规范以及采用何种方式(如公开羞辱或监禁)。这些关于规范执行者及其手段的二阶期望被称为元规范(metanorm),它决定了人们在规则被破坏时的反应方式。

本文提出一个评估大语言模型(LLM)元规范推理能力的框架,围绕情感评估和行为响应两个维度展开,并设计了两类分类任务:预测违规者的自我调节行为以及观察者的他律行为。为此我们发布了多视角数据集 NormReact,收录 450 条规范违背情境,手工标注了违规者的情绪、行为响应,并区分了违规者的性别以及观察者的社会亲密度。

实验在六种主流 LLM 上进行。结果显示,这些模型普遍倾向于过度预测负面制裁,而在人类更可能保持沉默的情境中也会给出惩罚性预测。随着观察者与违规者的社会距离增大,模型与人类判断的吻合度显著下降。

这些发现表明,在冲突调解、政策模拟等对规范敏感的应用场景中,AI 系统可能会呈现出一种扭曲的社会调节图景:惩罚被过度放大,而宽容、克制以及基于关系的微调则被低估。

点评

原文链接: https://arxiv.org/abs/2609.05437

[h] 返回首页