NeFut Logo NeFut
EN 管理员登录

[AI学术] ReLiveGym:评估跨周重放现实的长期智能体

发布于:2026-10-02 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

ReLiveGym 是一个用于诊断长期任务的评估环境,模拟数周的真实新闻、市场和社交媒体流的时间顺序重放。智能体在这些流中稀疏行动,任务覆盖不同的时间敏感度、推理强度和重复性。我们在八种基础语言模型上实验,考察模型选择和框架设计(尤其是何时行动的机制)对性能的影响。结果表明,行动时机的决定是长期任务的关键设计维度,最优设计随任务甚至模型而异。进一步,我们让智能体在事后反馈的基础上进行持续学习,观察到显著的性能提升并缓解了部分失败模式。研究提示,在构建长期运行的 LLM 智能体时,需要重点考虑模型本身、行动时机机制以及反馈利用方式。代码实现可在 https://github.com/SaharaLabsAI/ReLiveGym 获取。

点评:本工作提供了系统化的长期智能体评估基准,强调了时机决策和持续学习的重要性,为实际部署提供了实用参考。

原文链接: https://arxiv.org/abs/2610.00710

[h] 返回首页