学习机器人操作策略通常需要大量演示数据,而在真实机器人上收集这些数据成本高昂。近期方法通过从人类视频中恢复运动并在仿真中验证轨迹来生成机器人演示,但仅依赖运动参考的适配会保留原始接触策略和子任务顺序,限制行为多样性;对任务需求和场景关系的理解不足则会产生无效候选,降低生成效率。\
为克服这些局限,本文提出 KnowDemo 框架,利用人类视频中的结构化操作知识为目标工作空间生成多样化的机器人演示。我们首先构建基于视觉语言模型(VLM)的知识抽取与推理模块,将对象和动作描述映射到推断的任务条件、演示参考以及可允许的执行变体,从而将任务需求与演示特定选择区分开来。\
随后,框架将这些知识解析到目标场景的实体和几何信息上,引导候选轨迹的生成与筛选,随后进行运动规划和仿真验证。生成的演示展示了多模态行为,包括替代的接触策略和合法的子任务顺序,并附带结构化的执行标签。实验表明,相比仅基于参考配置的方法,KnowDemo 能够发现额外的可验证执行模式,并通过任务导向的抓取采样提升候选规划成功率。\
为了验证生成数据对策略学习的价值,我们在仿真数据上微调了预训练的 $\pi_{0.5}$ 模型,并在三个任务上实现了从仿真到真实的迁移。项目页面:https://zhiyuan-gao.github.io/knowdemo/
点评