在视觉-语言-动作(VLA)模型的后训练中,由于模拟器、机器人形态和任务目标的多样性,后训练显得尤为重要。现有的计算服务,无论是直接租赁加速器还是批量工作负载提交,通常将独占的GPU和CPU资源分配给单一租户。这种模式虽然最大化了客户的灵活性,但却给用户带来了基础设施适配的负担,同时固定的计费模式使得短期或突发工作负载对租户来说既昂贵又低效。
为了应对这些挑战,我们提出了JoyNexus,一个统一的多租户VLA监督微调、强化学习和评估服务。JoyNexus将训练模型服务、推理模型服务和环境服务解耦,通过API进行访问,并支持具有租户特定插槽的共享基础模型。租户可以通过高层语义API直接调用进行训练、回滚和评估,或使用低层API及其分配的端点组合自定义算法。多个租户可以同时提交工作负载;他们的动作模块、优化器、回滚记录和策略版本保持隔离,服务通过全局训练队列和推理队列进行调度。
为了进一步提高多租户训练效率,JoyNexus引入了针对共享兼容模型前缀的异构VLA数据模式的组批处理,允许在分组样本上执行一次共享的主干前向传播。
最后,我们通过工作负载模拟和现实化的组批流水线对JoyNexus进行了评估。结果表明,与隔离的单租户执行相比,JoyNexus通过跨租户调度共享资源,减少了总GPU时间,并提高了服务利用率。
博主点评: JoyNexus的设计巧妙地解决了多租户环境中的资源分配和利用效率问题,通过解耦服务和引入组批处理,降低了训练成本,提升了服务性能。这一创新将为未来的VLA模型训练提供强有力的支持,具有广泛的应用前景。