AI 生产力常用完成时间、经济价值或结果质量来衡量,但这些指标往往把协作视为黑箱,只记录产出而忽略产生产出的交互成本。受经济学文献启发,我们提出一种以结果质量相对交互成本的生产力框架来评估人机协作。实验覆盖四个任务的两个数据集,得到四点关键发现:
1)相同质量评分的会话,其交互成本差距可达 70 倍; 2)质量‑成本关系随任务而异,有的任务通过更长交互提升质量,有的任务则倾向快速收敛; 3)主观用户评分并不能可靠替代生产力指标; 4)高生产力会话的特征是代理更早发起探询,用户在修复交互时投入更少。
通过将生产力成功与高成本成功区分开来,该框架让交互成本可视化,并展示对话分析如何指导 AI 系统的评估与设计。
点评