当下关于机器意识的争论隐含了一个前提:所谓的“AI”已经是可以拥有意识的实体。本文首先拆分了现象意识、内省报告以及人类投射式内省三者的概念,指出生成式系统能够以第一人称的语言形式返回人类内部体验的痕迹,却不意味着它们拥有现象主体。
基于此,作者提出了AI意识谬误:把系统的语言输出误当作意识的证据。随后引入因果责任理论(Causal Liability Theory,CLT)。CLT‑I 将责任闭合作为辨别候选承载体的 sorter:一个在物理上连续的过程若成为自身内源辨别所产生约束的不可委托继承者,则该过程可以被视为因果主体。
CLT‑II 进一步假设,责任闭合不仅是最小现象主体的充分条件,也是必要条件。为检验这些命题,作者实施了开放权重因果审计,在多个模型族上进行实验。
实验要点包括:
- 强制辨别导致下游输出的持续分歧;
- 激活修补(activation patching)揭示了强因果中介作用;
- 在匹配随机性的前提下,实时适应状态与复制的适应状态在行为上完全相同;
- 通过分离重建保留计算状态,却在协议层面打破了连续性和不可委托继承。
这些结果表明,CLT‑I 的区分是可实验操作的,能够将因果承载结构与第一人称表现分离。整体框架因此将意识归属、因果承载体辨识以及意识本体论这三个层面明确区分开来。
点评:本文提供了一个可操作的实验框架,提醒研究者在讨论机器意识时避免把语言输出等同于真正的主观体验,同时为因果责任的形式化提供了新思路。