大语言模型在能够影响外部状态的系统中成为有意义的代理。当前模型能够调用工具、操作界面、委派任务、保持状态、居住在生成的世界,并控制机器人或实验室设备。
这些进展常被描述为向自主性的单一路径前进,却混淆了模型能力、系统集成、持久性和安全授权等概念。
本文在2026年8月31日前的公开研究和技术规范基础上,按“委托权威”“时间持久性”“环境耦合”三维进行组织,并区分模型、外壳(harness)和环境。
证据显示,动作接口的扩展(如工具调用、界面操作)比完整的任务完成、错误恢复、授权验证或独立验证更为可靠。
Model Context Protocol 与 Agent2Agent 提升了互操作性,但仍未提供可信的委托机制;多代理组织带来专业化的同时也增加成本和相关故障风险。
持久化仿真和世界模型有助于训练和规划,但本身并不等同于真正的代理能力;机器人和自驱实验室展示了受限可行性,却未实现无人值守的开放世界可靠性。
我们提出“合理委托”作为分析和规范的启发式,而非观察到的定律或认证分数:仅在证据支持来源、边界授权、故障检测、安全恢复和校准的人类控制的情况下扩展动作范围。
基于此框架,提出研究议程:耦合模型‑外壳评估、基于能力的权限、持久状态、跨代理问责以及分阶段的物理验证。
点评