摘要
图像描述通过语言模型(LMs)能够预测人脑对自然图像的反应,尤其是在高层视觉区域,但其预测能力的驱动因素尚不明确。为此,我们系统性地研究了图像描述的方式以及用于嵌入这些描述的语言模型。
我们针对一组共同的图像,考虑了六种不同类型的描述,包括人工标注和多种机器生成的描述,这些描述在多个维度上存在差异。每种描述都通过五种语言模型表示,这些模型包括自回归LM和经过语义任务微调的文本嵌入模型,后者要求对句子或文档级别的表示进行处理。
机器生成的描述在预测人脑反应方面表现出显著的有效性,且通常超越了之前工作中使用的人工标注描述。通过不同描述类型的分析,文本嵌入模型的一致表现优于自回归LM,这一模式在与图像相似性判断的行为一致性测量中得到了重复验证。
对不同模型层次的描述表示分析进一步揭示,脑预测能力和行为一致性在中间网络深度达到峰值,恰好在一个被认为标志着句法和语义结构出现的点之后。总的来说,我们的结果表明,图像描述的内容及其所使用的语言模型影响脑部和行为建模的表现,确立了描述嵌入作为研究高层视觉感知的有用工具。
博主点评: 本研究通过对语言模型在描述图像时的表现进行深入分析,揭示了机器生成描述在预测人脑反应方面的潜力,强调了语义结构的重要性。这为理解人类视觉感知提供了新的视角,尤其是在深度学习与认知科学交叉领域的应用前景上。