Vision‑language‑action(VLA)策略通过潜在接口将预训练的视觉‑语言骨干网络连接到动作头,但该接口应暴露哪些层仍未明晰。我们在三个预训练模型和两个操作基准(LIBERO、CALVIN)上,对冻结的骨干网络进行单层选择和多层融合实验,每种配置使用三组策略训练种子。实验覆盖三种融合机制和三种层子集策略,共 54 种配置,其中 47 种的表现不及最佳单层策略。统计分析进一步表明融合的优势极其有限。不同骨干和基准的最佳层差异显著,使得遍历搜索成本高昂。我们推导出动作条件 InfoNCE 与动作预测的信息瓶颈目标之间的重加权等价关系,进而将 InfoNCE 视为层质量的代理指标。实验证明,在四种评估代理中,InfoNCE 与策略成功率的正相关性最为稳健。选取 InfoNCE 最高的层可将 GPU 计算量降低 9‑33 倍,相比最深层选择将平均选择后悔值从 17.89 个百分点降至 3.71 个百分点(六组设置),其平均后悔值已接近使用全部六次全局搜索后回溯优化得到的固定层启发式(3.28‑3.50 个百分点),且无需在选择过程中进行闭环评估。
点评:该工作揭示了 VLA 系统中层选择的关键性,并提供了基于 InfoNCE 的高效选层方法,为实际部署中降低算力开销和提升策略性能提供了可行路径。