NeFut Logo NeFut
EN 管理员登录

[AI学术] VLA‑Scope:面向视觉‑语言‑动作模型的移位感知失败预测

发布于:2026-09-22 22:00 最后更新:2026-09-24 00:40
#algorithm #AI #Machine Learning

VLA‑Scope 是一个两阶段框架,用于在视觉‑语言‑动作模型的 OOD rollout 中预测失败。第一阶段利用图像和语言的池化表示检测 OOD 输入并划分 shift 类别。第二阶段对被标记为 OOD 的输入,结合预测的类别、动作前缀特征和执行进度特征,使用跨类别共享的逻辑回归模型随执行推进更新失败风险。

我们在 OpenVLA 上的十个 LIBERO‑Spatial 任务进行 leave‑one‑group‑out 交叉验证。OOD 检测的 ROC‑AUC 为 0.9454,shift 分类准确率 91%。在全部 1,400 条 OOD rollout 中,独立于 OOD 门的失败预测在执行 60 步后达到 ROC‑AUC 0.8497,高于不使用进度特征的 0.7906,也优于 ActProbe 和 SAFE‑MLP 基线。结果表明,将动作特征与时间聚合的执行步骤表示相结合,可提升在输入偏移下的失败预测能力。

点评

原文链接: https://arxiv.org/abs/2609.21246

[h] 返回首页