NeFut Logo NeFut
EN 管理员登录

[AI学术] FOCAL-VLA: 子任务引导的几何蒸馏与隐式世界建模用于视觉语言动作模型

发布于:2026-09-22 22:00 最后更新:2026-09-24 00:40
#Machine Learning #Neural #Geometry

Vision-language-action (VLA) 模型基于预训练的视觉语言模型,在多种机器人操作任务上表现出色。但直接将当前 2D 观测映射到动作的模型往往缺乏空间和时间理解,导致精细和长时程操作受限。近期方法通过几何监督和全场景未来状态预测来增强 VLA,却容易引入冗余信息,使模型难以聚焦于当前交互相关的几何和动力学。为此我们提出 FOCAL-VLA 框架,结合子任务引导的几何蒸馏和隐式世界建模,学习当前空间结构和未来交互动态的表征。几何蒸馏阶段,将几何教师模型 VGGT 的几何潜向与子任务相关图像区域的特征对齐,从而把几何知识迁移到 VLA。隐式世界建模阶段,利用 Track4World 在当前与未来演示帧中提取的特征,捕获交互的 3D 演化。两种表征在推理时共同指导动作生成,而无需在推理时运行 VGGT 或 Track4World。实验在仿真基准和真实机器人任务上均显著超越现有基线。项目页面:https://zhiyuan-gao.github.io/FOCAL-VLA/

点评

原文链接: https://arxiv.org/abs/2609.21228

[h] 返回首页