NeFut Logo NeFut
EN 管理员登录

[AI学术] 跨越满意度-多样性前沿的文本到图像扩散方法

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#algorithm #AI #Machine Learning

文本到图像生成允许用户从同一提示词得到多张图像。要让这些图像有价值,每张图像必须满足用户偏好(通过学习得到的奖励函数衡量),同时在视觉上保持多样性。现有方法要么只关注奖励,要么只关注多样性,或者把二者合并为一个综合得分,导致高多样性可以抵消低奖励。

本文将生成过程建模为满意化(satisficing):每张候选图像必须达到奖励下限,整个批次必须满足多样性阈值。奖励下限决定最差候选的奖励与批次多样性之间的平衡,调节该下限即可得到一条Pareto前沿。

为在推理阶段遍历该前沿,作者提出 SatisDive——一种无需额外训练的方法。SatisDive 采用批次相对奖励阈值,将低于阈值的候选视为需要提升奖励的对象,将高于阈值的候选视为需要保持多样性的对象,从而在同一批次中同步优化奖励和多样性。

实验在 Pick-a-Pic 基准上进行。使用 FLUX.1‑dev 作为基础模型、HPSv3 作为奖励时,SatisDive 在相同 DreamSim 分数下,使最差候选奖励提升最高 0.43;使用 SANA‑1.6B 作为基础模型、ImageReward 作为奖励时,提升最高 0.70。整体上,在所有 DreamSim 重叠区间,SatisDive 的满意度‑多样性曲线在每种设置下均Pareto‑支配 FK steering 的曲线。

点评:SatisDive 通过明确的奖励下限和多样性阈值,将两者解耦并实现同步优化,提供了一种简洁且训练无关的推理策略,为实际应用中的多图生成提供了更可控的质量‑多样性平衡。

原文链接: https://arxiv.org/abs/2610.02372

[h] 返回首页