摘要
大型语言模型和基于LLM的智能体广泛应用于个人聊天助手、企业副驾驶和自主工作流代理。在这些应用中,记忆(保留、访问和推理累积信息的能力)在决定智能体的可靠性方面起着至关重要的作用。我们推出了RECON(Reasoning over Extended Contexts with Obfuscated Narratives),这是一个用于评估长上下文中组合推理的基准。
RECON涵盖了三个领域(刑事、医疗和金融)中的24个案例文件,每个案例文件的字数从50k到100k不等,测试智能体在六个内存密集型任务中的表现:重构多跳证据链、传播级联失效、解决源冲突、反事实推理、满足时间约束和时间事实检索。
最近的内存基准评估智能体能否检索分散的事实或检测事实是否发生变化,而RECON则评估变化后发生了什么,智能体能否追踪哪些下游结论受到影响,哪些结论通过独立支持得以生存,以及替代时间线将如何展开。
我们的评估揭示了当前架构的重大局限性:即使是最强的非Oracle系统,其准确率也仅为22.4%,检索和推理均被证明是挑战。
博主点评: RECON基准的推出为评估智能体在复杂场景中的推理能力提供了强有力的工具,特别是在长上下文的处理上。当前智能体的表现显示出明显的不足,提示我们在设计更复杂的记忆机制时需加大研究力度。