NeFut Logo NeFut
EN 管理员登录

[AI学术] 寡头几乎无法左右多模型生态系统的模型崩塌

发布于:2026-09-12 22:00 最后更新:2026-09-15 01:15
#AI #LLM #Open Source

AI 生成的文本会回流到下一代模型的训练语料库,递归训练会导致模型崩塌。近期研究把这种设置扩展到多个模型相互喂养的情形,但大多数工作假设市场份额均匀分配,而真实的生成式 AI 市场是寡头垄断。

我们在受控生态系统中测试了两种担忧:

  1. 更少、更统一的来源是否会加速崩塌;
  2. 后续模型是否会被拉向寡头的输出。实验使用 13 个开源 1–4B 参数模型,形成 3 到 13 个玩家的自然生态系统,并注入一个探针模型将最高份额提升至 90%。每一代,所有模型的输出按市场份额混合进共享池,随后每个模型在保持干净基线权重的前提下重新训练该池,共进行五代。

结果显示,在我们测试的范围内,两种担忧均未实现。

真正决定速度的是提供文本池的主体以及这些主体被带动的程度:在保持份额不变的情况下,交换 K=3 生态系统的成员会使五代漂移变化 2.8 倍;对每个成员易感性的份额加权指数能够用 $R^2=0.68$ 解释 19 条实验臂的速度差异;将池中一半的文本换成人类文本大约会把漂移减半,却不改变漂移方向。

综上所述,在所测试的范围内,市场集中度既不决定崩塌的终点,也不决定其速率;速率由填充池子的文本来源决定。

点评

原文链接: https://arxiv.org/abs/2609.11146

[h] 返回首页