NeFut Logo NeFut
EN 管理员登录

[AI学术] 解耦规划与控制以实现可指令化智能体

发布于:2026-08-29 22:00 最后更新:2026-08-30 12:07
#AI #Machine Learning #LLM

近期研究表明,经过指令微调的预训练视觉语言模型(VLM)能够将指令和观测映射为高层次计划,但在陌生环境中将这些计划转化为可靠、低时延的动作序列仍然困难。与此同时,基于世界模型的控制器在观测到动作的快速映射上表现出色,却缺乏开放式任务指引。为此,本文提出 Instruct-to-Act 系统,将两者优势结合:在稀疏、高时延的文本指令(由 VLM 规划器生成)条件下,训练世界模型控制器以高频率自主执行。

为了让控制器能够接受语言指令,我们对控制器策略的回放片段重新标注合成指令,并在行为克隆目标上与已有的奖励最大化和世界模型学习目标共同优化。实验在七个具身环境中进行,其中包括三个多智能体环境——VLM 规划器通过语言协同,而训练好的控制器充当执行器。结果显示,在观测和动作空间匹配的前提下,解耦方法始终优于仅使用控制器或直接由 VLM 生成动作的基线,保持了快速控制的优势,并且可以在不微调的情况下替换不同的预训练 VLM 规划器。整体上,在七个任务中的六个上,本文方法与最强的视觉语言动作和多智能体强化学习基线竞争力相当。

博主点评:本文巧妙地将高层次语言规划与低层次快速控制分离,既保留了 VLM 的开放式任务理解,又利用世界模型的实时响应能力,展示了在复杂具身环境中实现可指令化智能体的可行路径。

原文链接: https://arxiv.org/abs/2608.26788

[h] 返回首页