NeFut Logo NeFut
EN 管理员登录

[AI学术] 掌握决策艺术:从反应控制到深思熟虑的规划

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#AI #Machine Learning #Reinforcement Learning

在这篇论文中,我们探讨了人工智能代理如何学习在快速反应决策与较慢深思熟虑规划之间切换的能力,即元推理。我们将反应决策建模为一个直接将状态观察映射到动作的策略。这种策略可以通过强化学习(RL)或模仿学习进行训练,但在其训练分布之外可能泛化较差。

相对而言,基于模型的决策时规划更有可能在更广泛的状态中产生良好的动作,但需要额外的计算时间,导致行动延迟。因此,我们提出了一种强化学习方法,用于训练元推理策略,通过对反应策略的不确定性评分进行条件分配计算。这一评分使得代理能够预测何时反应策略可能表现不佳,何时需要进行规划。

我们在运动规划和导航环境中进行了实证研究,表明该设计使元推理策略能够学习何时反应策略提供足够好的动作,何时需要决策时规划。此外,我们展示了该设计使元代理能够随着反应策略的改善而转向完全的反应控制。

博主点评: 该研究为人工智能的决策过程提供了重要的见解,特别是在动态环境中如何平衡快速反应与深思熟虑的规划方面。通过引入不确定性评分,代理能够更智能地分配计算资源,这是提升决策效率的关键。该方法在实际应用中具有广泛的潜力,尤其是在复杂的导航任务中。

原文链接: https://arxiv.org/abs/2607.16421

[h] 返回首页