NeFut Logo NeFut
EN 管理员登录

[AI学术] 信念状态引擎:在部分可观测环境下增强大语言模型的规划

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #LLM

大型语言模型(LLM)在许多任务上能够生成流畅的动作序列,但在环境仅部分可观测时会出现系统性失误。模糊的反馈容易导致模型提前做出决定,单一次有信息的观察甚至会把不确定性错误地收敛到错误假设上,随着历史的累积策略会逐渐漂移。我们将这些症状归因于一个共同的结构性缺陷:当前的 LLM 代理仅是一个以完整历史为条件的策略,却没有对隐藏状态保持显式的信念分布。

为了解决这一问题,我们提出了信念状态引擎(Belief‑State Engine,BSE),它作为一个独立的推理模块置于 LLM 之外。BSE 持有给定 POMDP(部分可观测马尔可夫决策过程)模型的贝叶斯后验,并在每一步决策时仅向 LLM 暴露该后验,而不直接呈现原始的动作‑观察日志。

BSE 必须满足四条公理:① 后验是对所有可能隐藏状态的概率分布;② 更新遵循贝叶斯规则;③ 后验仅依赖于先前后验、最新观察和所选动作;④ 当后验收敛时对应唯一的最可能隐藏状态。满足这些条件的内部状态被称为信念一致(belief‑consistent)。

在理论层面,我们证明:若 LLM 永不直接看到原始历史,则 LLM 与 BSE 的组合等价于在信念 MDP 上的马尔可夫策略,从而继承经典 POMDP 理论的 Bellman 最优性保证。

实验在经典的 Tiger POMDP 和一个红队攻击图任务上进行,对比了六个基线:反应式 LLM、Chain‑of‑Thought、ReAct、自然语言信念追踪器、QMDP 与 POMCP。结果显示,BSE‑增强的代理在任务回报、信念校准和决策一致性上均有显著提升。进一步的十项消融实验分别剔除每个架构要素,证实性能提升并非依赖于特定模型。

代码、环境规格、提示模板以及随机种子日志已随论文公开,便于复现。

点评:BSE 为 LLM 在部分可观测环境中的决策提供了明确的概率信念层,成功将传统 POMDP 的理论优势迁移到自然语言交互场景,展示了结构化推理与大模型生成的协同潜力。

原文链接: https://arxiv.org/abs/2609.10036

[h] 返回首页