NeFut Logo NeFut
EN 管理员登录

[AI学术] SceneBind:跨视觉、音频与语言的全方位场景绑定

发布于:2026-07-19 22:00 最后更新:2026-07-22 01:02
#AI #Machine Learning #Open Source

我们提出了SceneBind,一种具有联合语义和3D空间理解的全方位表示,能够处理现实场景中的视觉、音频和语言信息。现有的全方位编码器在实例级语义(即“什么在这里”)上表现出色,但通常缺乏明确的空间结构(即“在哪里”)。SceneBind通过将每个场景表示为一个语义-空间实体,结合全局语义嵌入和以对象为中心的语义-空间插槽,解决了这一问题。这种表示方式明确捕捉了对象级语义、空间属性和不确定性。

此外,我们还提出了SceneBind Matching,一种语义-空间匹配方案,整合了全局场景相似性和对象对齐,支持跨模态场景检索和对象定位。为了训练和评估SceneBind,我们策划了一个新的真实世界双耳音频-视觉数据集,包含结构化的语义和空间注释,并提出了一种训练协议,用于对齐不同模态中的语义和空间信号。SceneBind兼容大规模预训练的语义编码器,仅增加少量额外的标记即可实现轻量级空间建模。它在场景和空间检索上达到了最先进的水平,同时在音频-视觉定位等下游任务中实现了强大的零-shot迁移能力。

博主点评: SceneBind在多模态学习中填补了语义与空间理解的空白,尤其是在处理复杂场景时表现出色。其创新的匹配机制和新的数据集为未来的研究提供了良好的基础,值得关注!

原文链接: https://arxiv.org/abs/2607.15265

[h] 返回首页