在部分可观测的环境中,智能体必须在对世界状态缺乏完整了解的情况下行动,因而依赖于带有不确定性的状态估计管线。如何在这种不确定性下获得有根基且可验证的符号计划仍是核心难题。近期工作通过视觉语言模型(VLM)将感知与符号推理相结合,形成两大范式:第一种是 VLM‑as‑planner,直接将图像映射为动作序列;第二种是 VLM‑as‑grounder,将观测映射为符号谓词并作为离线规划器的初始状态。这两种方法均忽略了规划过程中的不确定性,导致鲁棒性受限。我们提出第三种范式——VLM‑as‑probabilistic‑grounder,它将 VLM 的谓词映射视为对符号状态的概率分布,从而在信念空间中进行规划,并在不确定性下生成稳健的计划。实验在模拟家居机器人场景中进行,结果表明相较于确定性 grounding,概率 grounding 能显著提升任务成功率和鲁棒性,展示了基础模型在不确定环境下可靠规划的潜力。
点评