合成数据能够突破人工标注的规模瓶颈,但也可能导致 模型崩塌:即使只使用固定比例的合成样本,模型的风险会出现不可消除的上限。本文聚焦于一遍 SGD 在高维线性回归(模型维度 $d\gg n$)下的行为,考虑真实数据与合成数据混合或分阶段使用的两种训练协议。
我们首先给出 有限样本风险上界,将传统的偏差‑方差分解与 源分布不匹配效应 分离。对混合训练,误差可写成 $$R_{mix}=\underbrace{\text{bias}^2+\text{variance}}_{\text{标准项}}+\underbrace{\text{fluctuation}+\text{persistent\ drift}}_{\text{合成导致}}.$$ 其中 fluctuation 表示合成与真实数据的随机混合噪声,persistent drift 则是两者分布差异在迭代中的累计偏移。对两阶段训练,误差形式为 $$R_{2stage}=\text{bias}^2+\text{variance}+\underbrace{\text{filtered\ initialization\ bias}}_{\text{仅在第一阶段出现}}.$$
上界揭示了两种协议的根本差异:混合训练会产生 强模型崩塌,风险下界不随真实样本数增长而下降;而两阶段训练只在预训练阶段使用合成数据,随后仅用真实数据微调,可完全消除风险底线。
在 随机 sketch 模型 下,我们进一步推导出 尺度律。在优化饱和 regime(SGD 已收敛),混合训练的风险随模型宽度 $m$ 近似为 $R_{mix}\sim \frac{m}{n_{real}}\cdot\epsilon_{syn}$,说明更大的模型会放大合成数据的负面影响。相反,两阶段训练的偏差项随合成预训练质量 $q$ 线性下降:$\text{bias}\sim \frac{1}{q}\cdot\frac{1}{\sqrt{n_{real}}}$。
最后,我们给出 必要且充分的有限样本条件,保证在相同真实数据预算且真实阶段更新次数相同的前提下,两阶段训练的风险严格小于仅使用真实数据的风险。
总体结论是:合成数据本身既不必然有害,也不必然有益;其效果取决于数据质量以及 如何在训练流程中引入。
点评