ARC-Bench 对冻结的 JEPA 风格世界模型(JEPA‑WM)在动作排序上的假设进行直接审计。 奖励自由的潜在世界模型通过在冻结的潜在空间中计算候选动作的嵌入与目标嵌入之间的距离来进行规划,距离越小的动作被认为越优。该方法隐含假设:潜在空间的距离排序与真实代价排序一致,即“潜在接近性可排序”。
我们提出 ARC‑Bench,一种 no‑leak、固定候选 的评估协议,测量冻结的 JEPA‑WM 是否能够正确对候选动作进行排序。该协议在公开的 JEPA‑WM 检查点上进行实验,覆盖导航(PointMaze)和操作(Manipulation)两类任务。
关键实验结果
- 在官方的操作任务审计中,得分最高的候选动作几乎总是次优,排名出现系统性倒置。
- 同样的倒置现象也出现在迷宫任务中。
- 通过将视觉骨干从 DINOv2 替换为在视频上预训练的 V‑JEPA 1 与 V‑JEPA 2(ViT‑L / ViT‑G 规模),缺陷仍然存在,说明问题不来源于特定骨干。
我们进一步排除了数据来源、训练不足、预算匹配的骨干对照以及度量循环等平凡解释。
为什么缺陷难以被发现
闭环重规划会在每一步重新评估动作,从而掩盖第一次规划时的排序错误。我们将规划器的重规划频率降低,结果在导航和操作任务上成功率急剧下降。被高频重规划“拯救”的轨迹在 PointMaze 的首次规划诊断中集中出现严重的排名错误。
因此,闭环成功率系统性地高估了冻结潜在表示的可排序性。ARC‑Bench 提供了量化该缺陷的测量手段,并解释了闭环重规划的掩蔽机制,为所有在潜在空间规划器上进行适配、摊销或重规划的工作提供了审计基准。
点评:ARC‑Bench 揭示了当前 JEPA‑WM 在动作排序上的根本性局限,提醒研究者在使用冻结潜在空间进行规划时必须检验其排序可靠性,尤其在低重规划频率的设置下。