AI 生成的文本会回流到下一代模型的训练语料库,递归训练会导致模型崩塌。近期研究把这种设置扩展到多个模型相互喂养的情形,但大多数工作假设市场份额均匀分配,而真实的生成式 AI 市场是寡头垄断。
我们在受控生态系统中测试了两种担忧:
- 更少、更统一的来源是否会加速崩塌;
- 后续模型是否会被拉向寡头的输出。实验使用 13 个开源 1–4B 参数模型,形成 3 到 13 个玩家的自然生态系统,并注入一个探针模型将最高份额提升至 90%。每一代,所有模型的输出按市场份额混合进共享池,随后每个模型在保持干净基线权重的前提下重新训练该池,共进行五代。
结果显示,在我们测试的范围内,两种担忧均未实现。
- 市场份额更加不均几乎不改变崩塌速度;
- 目的地(即最终的模型分布)几乎不受影响:不同的份额和身份设置只把五代末的结果偏移了整体漂移的几百分点。即使极端的份额配合最强的注入偏差,也不能保证对崩塌的引导,产生的话题转移在衡量崩塌的标尺上只留下微弱痕迹。
真正决定速度的是提供文本池的主体以及这些主体被带动的程度:在保持份额不变的情况下,交换 K=3 生态系统的成员会使五代漂移变化 2.8 倍;对每个成员易感性的份额加权指数能够用 $R^2=0.68$ 解释 19 条实验臂的速度差异;将池中一半的文本换成人类文本大约会把漂移减半,却不改变漂移方向。
综上所述,在所测试的范围内,市场集中度既不决定崩塌的终点,也不决定其速率;速率由填充池子的文本来源决定。
点评