在智能体AI中,前瞻性记忆是一个重大挑战,即在其他活动进行时,能够在特定的未来提示或状态下执行意图。我们引入了PM-Bench,这是一个基于文本的基准,用于测量现代大型语言模型(LLM)代理的前瞻性记忆能力。PM-Bench受认知科学中的虚拟周范式启发,评估LLM代理在多大程度上保持用户意图、执行延迟意图以及监控潜在环境变化。
在模拟的七天中,代理必须在继续进行的活动中判断是否有任何延迟任务到期。我们在PM-Bench上比较了八种最先进的LLM,采用八种不同的代理配置。PM-Bench在所有设置中都证明具有挑战性:最佳方法,即GPT-5.4代理,在我们的评估中仅达到65.1%的F1得分。此外,没有单一的策略能够在所有模型中普遍提高前瞻性记忆。我们发布PM-Bench作为一个受控测试平台,以诊断这些失败并开发支持可靠前瞻行为的训练或推理干预措施。
博主点评: PM-Bench的推出为评估大型语言模型的前瞻性记忆能力提供了重要工具,这在智能体AI的发展中至关重要。尽管当前模型的表现仍有提升空间,但这一基准的建立将推动未来的研究,帮助我们更好地理解和增强智能体的记忆能力。