在这篇论文中,我们提出了一种多模态数据的语言表示方法,将任何观察(无论是图像、视频还是文本)视为原子命题的集合,这些命题是关于场景中实体、动作和关系的简单陈述。通过一个全局语义代码本,将这些原子命题统一成一个共享的词汇,使每种模态和观察都置于一个可解释的空间中,这个空间涵盖了细粒度的事实到高级概念,并能组合成更丰富的表达。
这种方法带来了可解释性与推理能力,促进了跨模态理解与检索,以及组合性,进而实现复杂的多模态理解、丰富的数据策划和复杂的结构化检索。我们在自动驾驶和开放世界数据上演示了这一框架的应用。
博主点评: 本文提出的语言中心框架为多模态数据提供了一种全新的视角,通过原子命题的方式增强了模型的可解释性与跨模态处理能力,具有重要的应用前景,尤其是在自动驾驶等领域。期待未来能看到更多基于此框架的研究成果。