摘要
人-物交互检测(HOID)传统上被视为一个在预定义交互类别上进行的监督检测问题。尽管这种范式在封闭集基准上表现优异,但它将交互理解与数据集特定的监督紧密结合,限制了其在开放世界和组合场景中的泛化能力。近期的HOI检测器尝试通过提示策略利用多模态大型语言模型(MLLM)来转移交互特定的知识。然而,这些基于提示的方法主要集中于从预训练模型中提取判别表示,同时对其固有的多模态推理能力探索不足。因此,它们在处理模糊和开放世界交互场景时,难以提供有意义的上下文推理。
在这项工作中,我们提出了AgentHOI,一个无训练的代理框架,它将基础模型的通用多模态推理能力转移到野外的HOI检测中。AgentHOI不是学习交互分类器,而是模块化地协调互补的视觉基础模块,以进行开放式的语义推理和空间定位。为了解决复杂场景中不完整的交互发现和模糊定位的挑战,我们引入了两个关键机制:
- 上下文感知的多轮推理,逐步细化交互假设,以确保全面和组合的HOI发现;
- 多面交互定位,通过生成集成语义、空间和外观线索的实例特定描述来增强定位精度。
大量实验表明,AgentHOI在真实世界环境中超越了最先进的监督和弱监督方法,尽管不需要HOID数据进行训练。
博主点评: AgentHOI的提出体现了多模态推理在开放世界场景中的巨大潜力,尤其是在无需标注数据的情况下实现高效的交互检测。这一方法不仅提升了检测的准确性,也推动了人-物交互理解的研究进展,展现了多模态模型的广泛应用前景。