NeFut Logo NeFut
EN 管理员登录

[AI学术] 通过机械解释性与最优控制提升世界行动模型的鲁棒性

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:03
#AI #Machine Learning #optimization

摘要

世界行动模型 (WAMs) 使得语义和物理控制信息化,但在分布变化下表现脆弱。本研究利用机械解释性探讨鲁棒性相关扰动在 WAM 激活空间中的表现。通过对比成功与失败的执行过程,我们发现某些 WAM 架构在鲁棒性关键特征上表现出低维线性可分性,而其他架构则不然。这促使我们使用对比激活方向进行无训练的 WAM 引导。

我们还展示了 WAM 激活动态中的局部线性特性,使得通过基于模型的最优控制实现高效反馈引导成为可能,从而提出了世界行动线性二次调节器(WA-LQR),这是一种最小干预的降阶 LQR 控制器。通过机械评估,我们预测 Cosmos-Policy 和 DiT4DiT 模型具有强引导能力,而 LingBot-VA 的引导能力较弱,这与引导干预结果一致。在 Cosmos-Policy 和 DiT4DiT 上,WA-LQR 将对比方向推广到新任务,并在相机、抓手和视觉噪声扰动下提高鲁棒性,相较于未引导和提示引导基准有显著提升。

博主点评: 该研究通过结合机械解释性和最优控制,为世界行动模型的鲁棒性提供了新的视角,尤其在应对扰动时展现出显著优势。WA-LQR 的提出为模型在实际应用中的灵活性与稳定性提供了重要保障,值得在未来研究中深入探讨其应用潜力。

原文链接: https://arxiv.org/abs/2607.14943

[h] 返回首页