在人工智能领域,"代理"一词缺乏统一定义,这导致对代理研究的评估、比较和可重复性面临困难。本文围绕五个代理特征维度展开调查:环境交互、学习与适应、自治、目标导向行为以及时间一致性。针对每个维度,我们梳理了已有工作中对相应能力的概念化方式,并汇总了用于评估的度量、基准和评价框架。环境交互关注感知、动作空间以及与外部系统的实时反馈;学习与适应涉及在线学习、迁移学习以及对环境变化的快速响应;自治强调决策的自我驱动程度和对外部指令的依赖度;目标导向行为考察任务完成度、效率以及多目标权衡策略;时间一致性评估行为序列的连贯性和长期规划能力。通过对这些维度的系统化整理,本文揭示了当前评估方法的成熟点与不足之处,例如在时间一致性上缺乏统一基准。为弥补这一空白,我们推出了 Agent Compendium——一个公开的数字资源库,汇聚并扩展了本文识别的评估方法,提供统一的查询界面和可下载的实验配置。该资源旨在为研究者提供统一的评估结构,促进结果的可重复性、交流的清晰度以及对人工代理的系统化研究。
点评