近年来,自主代理在长期实验中通过改进模型、系统和其他技术工件方面表现出日益增长的能力。然而,要了解这种能力的当前状态,评估必须超越最终得分,因为最终得分既不能揭示进展是在哪里获得或丢失的,也不能表明累积的经验是否能改善后续决策。因此,我们提出了一个系统的评估框架,该框架基于规则的指标来描述七个前沿模型在36个长期视角任务中的行为。结果表明,当前的代理更像工程优化器而不是完全自主的研究人员:它们可以制定和实施实用的解决方案,但其性能在不同运行中有很大差异,其最强的解决方案主要是适应或组合已有的技术,真正的方法创新仍然很少。详细分析显示,观察到的性能受到多个因素的影响,包括导致类似最终结果的不同过程瓶颈、可以帮助或误导后续决策的经验重用以及影响性能稳定的设计。这些发现为改进模型训练、推理策略、经验管理和设计提供了具体的方向。 博主点评: 本文对长期视角人工智能研究与开发进行了深入的评估,揭示了当前代理的优势和局限性,为未来的研究方向提供了宝贵的参考。