可靠的网页代理监控在模型内部不提供不确定性信号(如 token logits)时极具挑战。本文聚焦于前缀级风险预测:给定一个不断演化的执行前缀,估计当前执行是否仍在正确轨道上,或正趋向失败。我们提出两类可观测轨迹表示:
- 宏观特征(Macro):汇总跨步的代理‑环境交互行为与反馈,捕捉整体趋势。
- 微观特征(Micro):通过对黑盒模型的重复查询,衡量意图、动作与预期状态变化的一致性。
与直接使用最终结果标签不同,我们标记关键步骤边界:即在观察到的后续执行中首次出现且未被纠正的致命错误,该错误与最终失败关联。这样可以保留失败轨迹中仍然“在轨”的早期前缀,避免过早判定。
在 WebArena‑Lite 与 Online Mind2Web 两大网页代理基准上,使用五种开源或闭源骨干模型进行实验。结果表明,可观测轨迹信号在风险预测上与依赖内部信号的基线方法相当,且在以下方面表现突出:
- 早期干预:在固定的误报预算下能够提前触发干预。
- 跨域迁移:对未见过的网站类别仍保持有效预测能力。
这些发现证明,仅凭外部可观测信息即可实现有价值的风险预测,为实际部署中的安全监控提供了新的思路。
点评