NeFut Logo NeFut
EN 管理员登录

[AI学术] 面向信念的 LLM 代理世界模型

发布于:2026-09-02 22:00 最后更新:2026-09-03 02:56
#Machine Learning #LLM #Artificial Intelligence

大型语言模型(LLM)已被用于许多领域的自主决策和规划。虽然 LLM 具备强大的推理能力,但在部分可观测的长时程任务上仍表现不佳。世界模型可以在训练和推理阶段提升策略性能。推理时,现有方法让代理通过世界模型模拟候选动作的后果,以此改进决策。然而,仅靠模拟无法完整捕捉当前状态的不确定性,这在部分可观测环境中尤为关键。为此,本文提出了信念式世界模型(BB‑WM),它维护一个可供 LLM 查询的信念分布,明确哪些信息已知、哪些仍不确定。我们首先探讨一个基础问题:直接向 LLM 策略暴露世界模型的信念是否能提升决策质量。实验表明,在部分可观测任务中,LLM 访问 BB‑WM 的信念能够显著提升任务成功率,并且该方式能够与传统的基于模拟的世界模型互补。代码已开源:https://github.com/skumar-ml/belief-world-models

点评

原文链接: https://arxiv.org/abs/2609.00455

[h] 返回首页