摘要
全模态检索旨在为文本、图像、视频、文档和音频输入建立一个统一的嵌入空间,但由于不同模态在数据分布、架构和优化动态上的差异,构建这样一个统一的检索器非常困难。在这项工作中,我们提出了Conan-embedding-v3,这是一种用于全模态检索的解耦-融合-恢复框架。
Conan-embedding-v3首先独立训练各模态专家,并将它们的任务向量融合为一个单一的密集骨干网络,这一策略被称为解耦专家融合。我们展示了这种融合可以组合视觉、视频和文档检索能力,但也暴露了基于投影器的模态的一个失败模式:当音频通过外部编码器和投影器连接时,融合的骨干网络使得投影器被校准为音频专家的骨干,导致尽管复制所有音频特定模块不变,但音频检索性能大幅下降。我们称这种失败为投影器漂移。
为了解决这一问题,Conan-embedding-v3应用了投影器恢复(即在保持骨干网络冻结的情况下对投影器进行全参数微调),然后进行平衡的多模态重演。最终模型支持这些检索路径在一个骨干网络中实现,在MMEB上取得了74.9的分数,并在30任务的MAEB音频套件中获得了55.61的得分。
博主点评: 该框架通过解耦与融合的策略,有效地整合了多模态检索的能力,尤其是针对投影器漂移问题的处理,展示了在多模态领域的创新思路。未来的研究可以进一步优化各模态之间的融合,以提升检索的效率和准确性。