NeFut Logo NeFut
EN 管理员登录

[AI学术] 算法影响揭示对齐的隐藏社会选择结构

发布于:2026-08-26 22:00 最后更新:2026-08-29 12:04
#algorithm #AI #Machine Learning

当 AI 算法的决策影响到多个个体时,对齐问题本质上转化为社会选择问题:如何将人们对系统行为的分歧偏好聚合为统一的模型?传统的前沿 AI 对齐方法——基于人类反馈的强化学习——几乎回避了这一核心问题,且缺乏可靠的社会选择保证。

本文提出,将算法的福利后果作为直接关注对象,可将对齐问题重新表述为对凸影响空间的线性优化。这一表述使得福利经济学和机制设计的标准工具能够直接应用。

在该框架下,任何对齐协议都可以映射到具体的福利后果;反之,社会规划者对福利后果的约束也可以转化为相应的对齐协议。我们利用此转换证明,议题投票(voting‑by‑issues)和随机独裁(random‑dictatorship)机制同时满足策略无关性和一致性。

进一步地,利用影响空间的线性结构,我们推导出一族在满足不同社会约束(如个人或群体伤害上限)的前提下,最大化功利社会福利的对齐协议。

我们在四个真实数据集上进行实验:肾脏分配、慈善食品分配、语言模型回复以及电车难题。实验显示,不同协议在整体福利、个体风险以及群体公平性方面的权衡与理论预测高度一致。

博主点评:本文将 AI 对齐与福利经济学桥接,提供了可操作的线性规划视角,为未来设计兼顾效率与公平的对齐机制奠定了理论与实证基础。

原文链接: https://arxiv.org/abs/2608.24046

[h] 返回首页