NeFut Logo NeFut
EN 管理员登录

[AI学术] 监控网页代理的可观测轨迹与关键步骤监督

发布于:2026-09-03 22:00 最后更新:2026-09-04 02:14
#AI #Machine Learning #LLM

可靠的网页代理监控在模型内部不提供不确定性信号(如 token logits)时极具挑战。本文聚焦于前缀级风险预测:给定一个不断演化的执行前缀,估计当前执行是否仍在正确轨道上,或正趋向失败。我们提出两类可观测轨迹表示

与直接使用最终结果标签不同,我们标记关键步骤边界:即在观察到的后续执行中首次出现且未被纠正的致命错误,该错误与最终失败关联。这样可以保留失败轨迹中仍然“在轨”的早期前缀,避免过早判定。

WebArena‑LiteOnline Mind2Web 两大网页代理基准上,使用五种开源或闭源骨干模型进行实验。结果表明,可观测轨迹信号在风险预测上与依赖内部信号的基线方法相当,且在以下方面表现突出:

这些发现证明,仅凭外部可观测信息即可实现有价值的风险预测,为实际部署中的安全监控提供了新的思路。

点评

原文链接: https://arxiv.org/abs/2609.02057

[h] 返回首页