NeFut Logo NeFut
EN 管理员登录

[AI学术] ProEvent:为主动代理打造的事件中心基准测试

发布于:2026-07-22 22:00 最后更新:2026-07-23 12:33
#AI #Machine Learning #LLM

摘要

主动代理被期望能够预测用户需求,通过感知环境上下文提供自主帮助,而无需明确指示。这类代理的基本能力是识别和跟踪用户即将发生的事件,从而实现持续且针对事件的帮助。例如,通过记录计划徒步旅行的时间和地点,代理可以提前发送天气提醒或在出发前提供导航支持。

然而,现有的主动代理研究在很大程度上忽视了事件中心的帮助,而主动帮助的开放性特性也给可靠评估带来了挑战。为了解决这些问题,我们引入了 ProEvent,这是第一个专为评估代理基于即时消息聊天主动维护用户时间表而设计的事件中心基准。

ProEvent 提供了合成但又真实的聊天记录,考虑了用户之间的动态互动、并发聊天线程以及现实世界中的噪声,并在响应时机、单步响应正确性和多步响应正确性上评估主动代理。对八个大型语言模型(LLMs)和流程的实验表明,当前的代理常常反应过度,并在事件取消方面表现不佳。值得注意的是,即使是 GPT-5.1 在 26.7% 的场景中也仅能正确反应。

进一步的定性分析揭示了当前 LLMs 作为主动代理的基本局限性,特别是在检测隐含事件和从用户第一人称视角推理方面。

博主点评: ProEvent 的推出为主动代理的评估提供了新的视角,强调了事件中心的重要性。当前 LLMs 的局限性凸显了在真实场景中实现有效主动帮助的挑战,未来的研究需要在理解用户意图与上下文感知上做出更多突破。

原文链接: https://arxiv.org/abs/2607.17701

[h] 返回首页