NeFut Logo NeFut
EN 管理员登录

[AI学术] 追踪、排名与破解:结构化工作记忆提升语言代理的多跳推理能力

发布于:2026-07-16 22:00 最后更新:2026-07-17 08:45
#algorithm #AI #Machine Learning

在多跳推理中,语言代理的表现随着推理链的延长而急剧下降,尽管每个单独的步骤都很简单。这一现象可归因于上下文稀释:代理的调查状态(已确认的内容、怀疑的内容及仍需确认的内容)仅隐含存在于不断扩大的上下文窗口中,早期的发现被后来的检索所掩盖。

我们提出了 SLEUTH,通过结构化的认知工作记忆使这一状态变得明确且可操作:代理维护与来源关联的已确认事实、按证据排名的活跃假设以及直接驱动其下一步行动的开放问题。在五个多跳基准测试和五个既定基准上,SLEUTH 的优势随着难度的增加而增强,从 HotpotQA 上的 +5 分到 4 跳链上的 +11 分,超越了 Reflexion,且无需多个回合。

在分析剩余差距时,我们识别出证据充分性问题:代理通常找到答案但未能做出承诺,耗尽预算进行不必要的验证。一个轻量级的承诺触发器可以解决这个问题,但仅在代理已经维护结构化状态的情况下有效:对一个无结构的代理应用相同的触发器并未带来改善,表明有组织的认知状态是有效承诺的必要条件。

最后,在较弱模型上强制遵循协议可以在最难的问题上恢复高达 +19 分,显示出代理如何组织其推理,而非原始模型能力,是提升多跳推理能力的关键因素。

博主点评: SLEUTH 的提出为语言代理的多跳推理提供了新的思路,通过结构化的工作记忆显著提升了推理效果。这一方法强调了信息组织的重要性,表明仅仅依赖模型能力是不够的,合理的结构化状态是实现高效推理的核心。希望未来能看到更多关于如何进一步优化这种结构化记忆的方法论研究。

原文链接: https://arxiv.org/abs/2607.12267

[h] 返回首页