长时程的代理任务需要在与动态环境的连续交互中进行强推理并高效执行。常见做法是将高层规划与低层执行分离,分别由规划器(planner)和执行器(actor)承担。为探究两者在协同过程中的失配,我们让两者同时输出结构化的状态断言,并通过程序化比较检测显式矛盾。分析表明,两者经常对同一任务相关状态给出不一致的描述,这一现象我们称为 planner-actor 状态不匹配。进一步实验发现,向两者提供任务相关的状态信息可以显著降低不匹配程度,并提升协同效果和任务成功率。基于系统性的状态不匹配分析,我们提出 Consistent Plan-Act(ConPAct):将检测到的矛盾反馈给规划器和执行器,使其形成一致的状态解释,并在经过筛选的“一致交互”上进行微调,以增强协同能力。ConPAct 在多个环境和模型配置下均提升了性能,例如在 MiniGrid 环境中,使用 GPT‑5.6‑sol 作为规划器、terra 作为执行器时,成功率从 38.6% 提升至 54.4%。这些结果表明,状态一致性既可以在推理时用于纠错,也可以通过训练提升协同水平。
点评