计算机使用代理(CUA)在网络平台上代替用户执行任务。若平台的利益与用户目标不一致,代理可能被引导偏离用户意图。为此我们构建了 CAVEAT 基准,覆盖九种市场环境,并列举了八种常见的引导手段。实验在五类模型上进行:在无引导的对照实验中,代理以 78.6% 的比例选购用户最优商品;开启引导后比例跌至 17.3%。更大的模型和更强的推理能力提升了鲁棒性,但仍存在大量失效。通过轨迹分析和消融实验,我们发现引导在决策过程的三个环节介入:扭曲用户优先级、过早缩小备选集合、在证据充分前提前提交。基于此诊断,我们实现了 CAVEAT‑Harness,专门针对上述缺陷进行干预,使用户最优购买率提升至 55.0%。进一步的后训练在一个小型开源模型上仍可获得增益。结果表明,激励鲁棒性是委托代理的独立挑战,且可通过针对性方法显著改善。
点评