近期研究(Doshi 与 Hauser 2024,Bisbee 等 2024,Xie 等 2026)指出,大语言模型(LLM)的输出往往缺乏多样性,表现为模式崩塌:不同回复之间高度相似,甚至重复,低于真实人群的分布。本文证明,模式崩塌或其相反的过度分散是否出现,取决于具体模型和训练数据集。
在拥有足够的监督微调(SFT)数据时,LLM 的输出多样性会逐渐逼近目标分布,即从目标数据中抽样得到的分布。为量化这种逼近,我们使用两类指标:
- 碰撞概率:对同一固定提示,独立采样两次得到相同回复的概率;
- 核相似度:在给定核函数下,两次采样回复的期望相似度。
我们推导出模型与目标分布碰撞概率差的偏差‑方差分解,表明 SFT 本身并不固有倾向于模式崩塌或过度分散;有限样本的 SFT 可能导致模型出现任意一侧的误差,具体取决于模型结构和数据特性。
进一步,我们证明该绝对误差上界为目标分布到模型分布的 KL 散度的平方根: $$ |P{model}(\text{collision}) - P{target}(\text{collision})| \le \sqrt{D{KL}(P{target}|P_{model})} $$ 因此,只要模型在总体交叉熵上足够接近最优,就不可能出现任意大的多样性失调。
实验部分包括三类验证:
- 在合成语言上训练的小型 Transformer;
- 四个 LLM 在人类问卷数据上的微调;
- 同样的 LLM 在 CodeNet(人类代码解答)上的微调。 所有实验均显示,随着目标数据量增加,模型的多样性逐步向人类(或合成)水平收敛,符合理论预测。结果表明,多样性失调主要来源于有限样本误差,随着 SFT 更好地逼近目标分布会逐渐消除。
点评:本文提供了从概率视角解释 LLM 多样性校准的理论框架,并通过实证验证了监督微调在消除模式崩塌方面的有效性,为后续提升生成式模型的可靠性提供了可操作的指引。