本文提出一个端到端评估框架,用于检测图像触发的指令注入对计算机使用代理(CUA)的影响。框架验证本地视觉补丁是否能够在截图输入、视觉语言模型(VLM)生成、动作解析以及环境执行的完整链路上产生可验证的环境后果。我们在作者可控的 GitHub Pages 页面和本地部署的 CSDN 克隆站点上训练并部署补丁,并在五个开源或公开可用的 GUI‑agent 或 VLM 后端上进行真实环境评估。实验共收集 600 条在线实例,指标 T‑ASR、TAPR、E2E‑ASR 分别达到 84.5%、47.0% 和 20.3%。轨迹分析显示,在部分成功案例中,代理先执行恶意终端命令,随后继续原本的良性任务。结果表明,经过优化的本地视觉信号不仅能影响 VLM 输出,还会通过开放 CUA 的执行流水线传播,构成真实的环境风险。
点评