NeFut Logo NeFut
EN 管理员登录

[AI学术] 约定差距:衡量合作AI评估中的隐式沟通

发布于:2026-09-12 22:00 最后更新:2026-09-15 01:15
#algorithm #AI #Machine Learning

在合作AI的评估中,传统做法只考虑显式信息,而人类合作依赖隐式约定——超越字面信息的共享协议。我们提出约定差距(convention gap),即从通信的字面内容预测的失败概率与实际观察到的失败率之间的差值,用以量化隐式沟通。

在纸牌游戏Hanabi中,由于牌组有限且提示规则确定,这一后验可以精确计算。我们重放了约101,000次行动,来源于三套公开数据集:人类‑人类(hanab.live)、AI‑AI(HOAD)和人类‑AI(HanabiData)。

结果显示,人类配对的差距为+26.2个百分点(pp),AI配对为‑0.7 pp,人类‑AI配对为+16.4 pp,且差距主要集中在未收到提示的牌上(人类配对中为+46 pp)。

在人类‑AI的交互中,三种AI伙伴提供给人类的字面信息相近(预测失败率在38%‑41%之间),但实际人类失败率从14.4%到34.4%不等,差距从+24.1 pp降至+6.2 pp;产生最大差距的伙伴反而导致人类错误最少。

游戏得分携带了不同的信息,取决于各数据集的角色组合,而约定差距能够在代理层面区分人类与AI的表现。

作为已知答案的检验,Off‑Belief Learning 代理在无约定层面产生+1.6 pp的差距,随着约定程度提升,差距单调上升至+21.7 pp。

这些发现表明,约定兼容性可能比单纯的AI‑AI性能更能预测AI与人类伙伴的协作效果。

点评

原文链接: https://arxiv.org/abs/2609.11489

[h] 返回首页