摘要
随着文本到图像(T2I)系统的快速发展,评估生成内容的文化真实性变得愈加重要,以确保生成式 AI 的公平性和可信性。现有的 T2I 评估指标及多模态评估者通常依赖于视觉-语义表示,未能充分体现隐含的文化规范,导致偏见的偏好判断和细微文化线索的遗漏。此外,基于视觉问答(VQA)的评估者通常依赖自回归文本生成,这限制了其在实时奖励建模中的可扩展性。
为了解决这些限制,我们提出了一种隐含文化对齐奖励模型,该模型建立在一个轻量级的 42 亿参数的多模态大型语言模型(MLLM)之上。我们的框架集成了隐含文化探针和跳跃连接交叉注意力(SkipCA)机制,使得后期语义特征能够直接关注早期视觉表示,从而更好地保留文化显著细节。
在来自 CulturalFrames 基准的 3,323 对具有挑战性的精心策划的图像对上的评估显示,我们的方法达到了 80.54% 的成对准确率,Pearson 和 Kendall 相关系数分别为 0.546 和 0.377,超越了代表性的视觉-语言指标和基于 MLLM 的评估者。此外,通过绕过自回归文本生成,我们的模型在本地推理设置下每次评估处理时间为 0.21 秒,相较于标准的 VQA 评估者实现了 $10 imes$ 的加速。这些结果表明,所提出的奖励模型能够为偏好优化管道(如人类反馈强化学习和直接偏好优化)提供高效且具有文化敏感性的标量信号。
博主点评: 这一研究通过引入隐含文化对齐奖励模型,显著提升了文本到图像的评估质量,尤其在文化敏感性方面表现突出。传统方法由于依赖自回归生成存在速度瓶颈,而新模型的快速处理能力为实时应用提供了可能,具有广泛的应用前景。