最近,多模态检索和分类技术逐渐发展,涉及文本、图像、视频和音频等多种媒体类型。传统的方法主要采用双编码器模型,通过对比学习来对齐视觉和文本表示。2026年3月,Google发布了Gemini Embedding 2,这是首个原生多模态嵌入模型,能够将文本、图像、视频、音频和文档映射到同一个共享空间中。这一技术的发布激发了多模态检索系统之间的竞争。同时,前沿的大型语言模型(LLMs)也表现出强大的视觉理解能力,引发了人们对其作为有效的零样本排名器的潜力的疑问。我们的研究提供了对原生多模态嵌入和基于LLM的视觉排名的首次直接比较,基于Flickr30k数据集。我们观察到GPT-4.1和Claude Sonnet 4.6的性能与Gemini Embedding 2相当。此外,一旦嵌入预先计算,多模态嵌入更适合低延迟应用。 博主点评: 本文揭示了前沿LLMs在多模态检索任务中的潜力,并强调了原生多模态嵌入在低延迟应用中的优势,展现了多模态技术的快速发展和LLMs的广泛应用前景。