NeFut Logo NeFut
EN 管理员登录

[AI学术] 美丽无用:现代文本到图像模型为何无法成为可靠的训练数据生成器

发布于:2026-07-19 22:00 最后更新:2026-07-22 01:02
#AI #Machine Learning #Open Source

摘要

最近的文本到图像(T2I)扩散模型生成了视觉上令人惊叹的图像,并展现了优秀的提示遵循能力。但它们作为合成视觉数据生成器的表现如何呢?在这项研究中,我们重新审视了合成数据作为真实训练集可扩展替代品的前景,并揭示了令人惊讶的性能回退。我们使用2022至2025年发布的最先进T2I模型生成大规模合成数据集,仅基于这些合成数据训练标准分类器,并在真实测试数据上进行评估。

尽管在视觉真实感和提示遵循方面可观察到进展,但在真实测试数据上的分类准确率随着新T2I模型作为训练数据生成器的使用而持续下降。我们的分析揭示了一个隐藏的趋势:这些模型收敛到一个狭窄的、美学中心的分布,削弱了多样性和真实数据分布的覆盖度。

总的来说,我们的发现挑战了视觉研究中一个日益增长的假设,即生成现实主义的进步意味着数据现实主义的进步。因此,我们强调迫切需要重新思考现代T2I模型作为可靠训练数据生成器的能力。

博主点评: 现代文本到图像模型在视觉表现上取得了显著进步,但其作为训练数据生成器的能力却未能同步提升。研究结果提示我们,依赖这些模型生成的数据可能会导致模型训练的多样性和准确性下降,值得引起广泛关注与反思。

原文链接: https://arxiv.org/abs/2602.19946

[h] 返回首页