NeFut Logo NeFut
EN 管理员登录

[AI学术] 突破性研究:TS-Mask VLA模型提升视觉-语言-行动能力

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:46
#algorithm #AI #Machine Learning

在这项研究中,作者提出了TS-Mask VLA,一个用于机器人操作的视觉-语言-行动(VLA)框架。该模型旨在理解自然语言指令和视觉观察,并生成及执行相应的行动。现有的自回归基于令牌的动作生成方法常常将动作生成简化为下一个令牌的预测,缺乏对动作序列时空结构的明确建模,限制了在长时间跨度和复杂场景中的表现。

TS-Mask VLA的设计基于两个关键要素:

  1. 离散扩散动作专家:配备了桥接注意力机制,能够实现多层次的条件输入,提升了动作生成的准确性和稳定性。

  2. 时空2D掩码策略:针对离散动作令牌,增强了模型对跨时间依赖关系和维度耦合的理解,进而生成结构一致性更强的动作序列。

在大量的仿真基准测试和实际任务中进行的实验表明,TS-Mask VLA在LIBERO上以仅0.5B的参数达到了95.7%的平均成功率,显著优于更大规模的模型。而在CALVIN上,它获得了最佳的平均序列长度4.19,并表现出卓越的长时间跨度性能。全面的分析和消融实验进一步验证了我们设计的有效性。

博主点评: TS-Mask VLA模型通过创新的时空掩码策略和高效的多层次条件机制,显著提升了机器人在复杂任务中的表现,展现了VLA模型在实际应用中的巨大潜力,值得关注和深入研究。

原文链接: https://arxiv.org/abs/2607.09818

[h] 返回首页