主动模仿学习通过让学习者主动请求所需示例来降低专家的工作量。现有方法通常依据对专家策略的期望信息增益来选择请求,但在结构化的多任务环境中,起点‑目标任务的组合数会呈指数增长,而这些任务往往共享可复用的行为。可组合的行为因此尤为重要,一次示例可能同时帮助解决多个任务。先前的工作在选择示例时并未显式考虑这种价值。
我们提出自适应代理经由潜在拓扑 (AALT),其请求的示例最大化起点‑目标连通性的期望提升,并且该目标与任务可达性的信息增益形式上等价。AALT 将已有示例组织成由学习到的行为连接的潜在枢纽状态拓扑,识别出高价值的桥接示例,这些示例能够一次性开启大量任务,并将每条桥接映射到一次专家查询。推理阶段,系统在该拓扑上规划,并在每次枢纽转移时对扩散策略进行条件化。
在一个包含 72 项任务的 UR5e 机器人有序检索仿真环境中,AALT 只需在初始数据集之外额外使用 3 条示例(共 5 次转移)即可实现 72/72(100%)任务成功。相比之下,最强基线在使用 20 条示例(98 次转移)后平均成功率为 88.6%。
点评:AALT 通过显式建模示例之间的可组合性,显著提升了主动模仿学习在大规模任务集合中的效率,展示了在机器人操作中利用少量高价值示例的潜力。