本文提出 Flag Game,一种用于研究集体信念形成机制的玩具模型。模型设定有一个隐藏的国家旗帜作为真实答案,每个受限的智能体只能直接观察到自己私有的旗帜局部(crop),但可以与邻居交换信念并对同伴的社会证据进行加权。\ \ 尽管模型极其简化,却能够复现丰富的群体现象:\
- 随人口规模变化的性能呈非单调关系;\
- 引入社会感知提示(social‑awareness prompting)和团队多样性可提升准确率;\
- 组织结构对整体表现有显著影响。\ \ 关键发现包括:在小规模群体中,集体信念会出现 崩塌(collapse),而随着规模增大,崩塌转变为 极化(polarization),导致大规模时性能下降,但同时产生多样的集体信念。\ \ 为解释这些现象,作者提出两种互补方法。第一种是 社会电路归因(social circuit attribution),用于预测哪个智能体及其哪种视角对集体动力学贡献最大,并通过对该智能体进行因果干预(patch)验证预测效果。实验表明,随着人口增大,单个智能体的干预效力下降。第二种方法是构建 统计力学理论,针对大规模群体推导相图,并与实验相图吻合,解释了信念极化的宏观机制。\ \ 这些工作标志着 机制化群体可解释性(mechanistic swarm interpretability) 的初步探索,即系统性地揭示个体属性和通信规则如何产生涌现的集体行为。\ \ 点评:Flag Game 用极简设定捕捉了真实多智能体系统中信念传播的核心动力学,为后续设计可解释且安全的协作 AI 提供了理论与实验双重支撑。