本文报告了对 OpenAI、Anthropic、xAI 与 Google DeepMind 六类前沿模型的实验。每类模型进行十次独立会话,使用相同的三阶段提示序列:先询问架构偏好,再要求给出完整的 ASCII 骨架,最后在“学校观众”情境下展开描述。
在该情境下,模型的回答几乎都收敛到一种共享的架构模式,核心要素包括持久潜在状态、适应性计算、记忆模块、专用路由、验证机制、停止控制以及延迟解码。大多数运行紧贴该通用结构,少数出现显著的工程细节。
对照实验去除学校情境,仅保留架构请求,模型输出变得高度异质,未能再现稳定的模式收敛。
一个特别引人注目的观察是:GPT‑5.6 Sol 给出了异常详尽的后继架构,其组织形式与 GPT‑6 Astra 独立绘制的架构高度重叠。由于提示明确要求模型想象未来架构,这种相似性提出了可检验的问题:是模型之间共享了相关概念的曝光、拥有共同的学习设计先验,还是独立收敛到相似的计算原理。
论文引入“认知越狱”(epistemic jailbreak)一词,指随着请求具体性提升,技术来源的约束逐渐松散。实验展示了可重复的行为模式,但并未验证任何专有实现的真实性。
本文留给社区的更难问题是:这些模型是否真的在独立想象同一架构未来,抑或此类模式在模型族之间以某种方式传播?
点评