NeFut Logo NeFut
EN 管理员登录

[AI学术] Spatial-Interactor:通过与可观测物理世界交互学习空间推理

发布于:2026-09-23 22:00 最后更新:2026-09-24 00:40
#AI #Machine Learning #Vision-Language

空间推理是视觉语言模型(VLM)在真实世界中理解与行动的关键。动态环境要求模型感知因物体运动和视角变化产生的局部状态转移,并在长时间轨迹上持续更新空间状态。然而,现有 VLM 在这两方面仍显不足。当前的空间训练主要聚焦于静态的属性和关系提问,缺乏对状态转移的直接监督。相反,交互轨迹天然包含前后观察与动作的对应关系,能够为局部状态转移提供直接标签,而完整轨迹则揭示连续转移之间的依赖关系。

为此我们提出 Spatial-Interactor 框架,旨在通过交互学习物理世界的状态转移。学习过程被组织为三层课程:L1 被动世界状态转移、L2 主动自我状态转移、L3 长时程交互轨迹。基于此我们构建了 Learning from Spatial Interaction 数据集(LSI-108K),涵盖模拟与真实交互轨迹,并为每一层设计对应任务。

训练采用两阶段策略。第一阶段对 L1 与 L2 进行监督微调(SFT),专注于局部转移建模。第二阶段引入在策略蒸馏(OPD),利用特权自蒸馏:教师分支提供片段级转移描述,监督学生在策略下的思考链(CoT),帮助学生在 L3 长轨迹上整合连续转移。

在多个 VLM 与空间基准上的实验表明,框架在局部转移建模和长时程整合上均实现了稳定提升。

点评

原文链接: https://arxiv.org/abs/2609.23038

[h] 返回首页