现代视觉‑语言‑动作(VLA)策略在一次前向传播中预测整个动作块,时长约一到两秒。动作块本质上是一段多变量轨迹,但在现有模型中,它被视为逐帧的隐藏 token 序列,由线性头解码。这种设计忽视了两类运动结构。第一是频率维度:动作块同时包含平滑的全局趋势和细粒度的校正运动,跨越不同时间尺度,而单一 token 将两者纠缠在一起。第二是跨相位几何:不同相位(如伸手、接触、抓取微调、稳固)在表征空间中沿近乎正交的方向展开,却在任务层面紧密关联,并沿时间轴出现。点积注意力通过内积衡量相似度,倾向于对齐的 token,对近正交的关系不敏感,导致网络需要额外路径来恢复这些信息。为此我们提出时频几何交叉注意力(TFGCA),它可以直接插入现有 VLA。TFGCA 为每个维度学习一个平稳小波变换,将动作块分解为时频 token;随后每个时间 token 通过交叉注意力从这些时频 token 中检索信息。交叉注意力同时融合点积相似度和楔积幅值(对近正交敏感),两者的加权系数由可学习参数决定。一个零初始化的残差分支在初始化时复制基线行为,使得 TFGCA 能够直接加到预训练 VLA 上并联合微调。实验表明,相比同源基线模型,TFGCA 在内部分布的 LIBERO 基准上平均提升 1.5 分,OOD LIBERO‑Plus 上提升 6.3 分,在 RoboTwin 随机化环境下的随机平均提升 28.5 分,三项真实机器人 AgiBot A2 任务的整体成功率提升 11.67 点,尤其在分布外表现更为显著。
点评