NeFut Logo NeFut
EN 管理员登录

[AI学术] 释放多模态大型语言模型,开启无训练人-物交互检测的新篇章

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:19
#AI #Open Source #Multimodal

摘要

人-物交互检测(HOID)传统上被视为一个在预定义交互类别上进行的监督检测问题。尽管这种范式在封闭集基准上表现优异,但它将交互理解与数据集特定的监督紧密结合,限制了其在开放世界和组合场景中的泛化能力。近期的HOI检测器尝试通过提示策略利用多模态大型语言模型(MLLM)来转移交互特定的知识。然而,这些基于提示的方法主要集中于从预训练模型中提取判别表示,同时对其固有的多模态推理能力探索不足。因此,它们在处理模糊和开放世界交互场景时,难以提供有意义的上下文推理。

在这项工作中,我们提出了AgentHOI,一个无训练的代理框架,它将基础模型的通用多模态推理能力转移到野外的HOI检测中。AgentHOI不是学习交互分类器,而是模块化地协调互补的视觉基础模块,以进行开放式的语义推理和空间定位。为了解决复杂场景中不完整的交互发现和模糊定位的挑战,我们引入了两个关键机制:

  1. 上下文感知的多轮推理,逐步细化交互假设,以确保全面和组合的HOI发现;
  2. 多面交互定位,通过生成集成语义、空间和外观线索的实例特定描述来增强定位精度。

大量实验表明,AgentHOI在真实世界环境中超越了最先进的监督和弱监督方法,尽管不需要HOID数据进行训练。

博主点评: AgentHOI的提出体现了多模态推理在开放世界场景中的巨大潜力,尤其是在无需标注数据的情况下实现高效的交互检测。这一方法不仅提升了检测的准确性,也推动了人-物交互理解的研究进展,展现了多模态模型的广泛应用前景。

原文链接: https://arxiv.org/abs/2607.13881

[h] 返回首页