6G 预计提供大规模具身智能的关键基础设施,异构机器人通过低时延连接、边缘智能和分布式感知协同工作。视觉‑语言‑动作(VLA)模型通过统一的闭环策略整合视觉感知、语言理解和动作生成。然而,将 VLA 模型训练并适配到分布式机器人上会面临隐私保护、通信效率和模型异构性等挑战。传统联邦学习忽视了视觉、语言、动作通路在参数规模、隐私暴露、更新动态以及对压缩或扰动容忍度上的固有差异。
为此,本文提出 FedMVLA,一种模态解耦的联邦学习框架,专为 6G 环境下的隐私保护具身智能设计。FedMVLA 包含三大机制:
- MAFA(模态感知联邦聚合):针对不同模态采用差异化的聚合权重和频率,确保视觉、语言、动作参数各自的收敛性。
- MAPA(模态感知隐私分配):依据模态的隐私风险分配差分隐私预算 $\epsilon$,如对动作流使用更严格的 $\epsilon_{action}$。
- MACO(模态感知通信压缩):对视觉和语言参数采用高压缩率的量化/稀疏化,对动作流保持低压缩以满足实时性。
此外,FedMVLA 设计了 模态切片传输,将对精度敏感的动作流通过受保护的超可靠低时延切片(URLLC)传输,其余模态走常规增强型移动宽带(eMBB)切片。
案例研究在基于 3GPP 的无线底层上进行,考虑衰落、同频干扰和恶意干扰。实验结果显示:
- 任务成功率 84.8%,比 FedAvg 提高 22.2%。
- 在 8 个小区、128 客户端规模下,成功率保持增长趋势。
- 客户端上行模型更新负载下降约 95.6%(≈96%),且第 95 百分位上行完成时延约 1.5 s。
这些结果表明,模态解耦的聚合、隐私和压缩策略能够在保证隐私和实时性的前提下,大幅提升分布式机器人协作的效率和可靠性。
点评