NeFut Logo NeFut
EN 管理员登录

[AI学术] 多轴最大化强化学习:提升文本到图像生成的多样性

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:03
#AI #Machine Learning #optimization

摘要

文本到图像(T2I)模型能够合成逼真且与提示相符的图像,但对于相同提示生成的样本往往只涵盖少量视觉上独特的模式。这限制了图像的多样性,对以人群为中心的提示可能反映或放大人口偏差。我们将此问题形式化为覆盖预定义的、语义上特定的模式,称之为目标模式覆盖。

我们提出了多轴最大化@K(multi-axis max@K),一种基于群体的强化学习目标,旨在改善扩散基础的T2I模型中的目标模式覆盖。给定一组样本和每个目标类别的一个评分,多轴最大化@K首先在每个类别中对样本的最大评分进行计算,然后对这些类别最高值求和。最终的信贷分配机制仅在样本提升该类别的组最高值时才给予该样本正权重,从而允许不同样本对不同类别做出贡献。

我们首先在合成混合和SD3.5-M上验证了信贷分配机制,使用确定性的基于像素的颜色奖励。随后,我们在感知外观公平性上评估了相同目标。在对保留提示的三个自动评估器中,多轴最大化@K相较于基础模型提高了公平性评分0.23-0.36,同时保持了图像质量和文本一致性。

博主点评: 该研究提出的多轴最大化@K强化学习方法有助于提升文本到图像生成的多样性,尤其在处理人群相关的提示时,能够有效缓解潜在的偏见。通过优化样本的类别贡献,该方法在保持图像质量的同时,显著提高了生成结果的公平性,具有重要的应用前景。

原文链接: https://arxiv.org/abs/2607.14962

[h] 返回首页