在长时程 AI 代理日益强大的背景下,用户与代理的交互却显得相对薄弱。用户通常只提供初始指令,接收到的更新信息有限,导致难以掌握代理的具体操作和何时介入。这一现象揭示了当前代理生态系统中的一个缺失部分:一种始终在线的 Jarvis 风格的中介,能够持续与用户进行实时语音交互,回答问题而不打断工作,主动报告进展或困惑,并在合适时机将用户的指导信息注入代理的执行过程中。
为此,我们提出了 JarvisBench,一个用于衡量长时程代理工作流中中介双重价值的基准。JarvisBench 包含两个互补的轨道:一个是代理协作轨道,用于评估中介是否提高了下游任务的完成度,另一个是用户交互轨道,用于评估中介是否使执行过程更加易于理解、响应迅速且用户可接触。
我们使用模块化的 Jarvis 原型实例化该基准,并在 OpenClaw 中评估了 34 个仅文本的 WildClaw 任务。初步结果显示,使用 GPT-5.5、Claude Opus 4.7、Gemini 和基于 GPT 的工作代理时,Jarvis 风格的中介能够为用户问题提供基于追踪的响应,并在适当时机注入稀疏的用户指导,从而提升任务表现。此外,效果的好坏与中介的 LLM 脑模型密切相关,这突显了这一缺失中间层的潜力以及更广泛的社区努力的必要性。演示页面可访问 Jarvis Demo。
博主点评: JarvisBench 的提出为长时程 AI 代理的用户交互提供了重要的解决方案,强调了中介在提升用户体验和任务完成度方面的关键作用。随着技术的发展,此类系统将更好地服务于复杂的工作流,值得行业内的进一步探索与实践。