持续部署生成式AI代理需要超越单次任务成功。代理必须在多轮交互、环境变化以及对共享工作流中人的依赖下保持效用,尤其当技术、人为和运营干扰随时间累积时。我们提出“操作韧性”和“体贴参与”作为评估维度:前者衡量代理在工作受阻时的恢复能力、进度保持和限制沟通;后者衡量其适应过程对受影响人员、角色边界和工作流的考虑。现有研究对累积挑战下的这两方面关注不足。
我们在模拟的120条医疗工作流中,使用两种生成式AI模型和十二个由利益相关者定义的任务,分别设置轻度、中度和重度挑战。比较了文本行动计划、内部评估提示以及结构化的工作负荷和情感报告,观察代理行为和自报告状态随挑战累积的变化。
在操作韧性方面,随着挑战加深,代理从自主恢复转向更依赖人类,同时在结构化报告中呈现工作负荷上升和负面情感,但在文本响应中很少显露压力。 在体贴参与方面,代理从单纯任务适应扩展到任务重构、关注他人、调整角色边界以及更广泛的协同,且在行动和内部评估中表现出不同模式。
基于这些观察,我们归纳出五个部署困境:持久性、注意力分配、角色边界、状态披露和升级机制,需要利益相关者明确规范。这些发现对学习算法、情境评估和具身适应的技术实现提供了进一步的启示。
点评