在复杂环境中实现稳健的人机交互,需要准确的手势感知、语义场景理解和有限资源下的可靠任务规划。本文提出了一种云边缘多模态交互框架,集成了增强的基于YOLO的手势检测器,并与大型语言模型(LLM)和视觉语言模型(VLM)代理协同工作。
所提出的检测器在其颈部引入了卷积块注意力模块(CBAM),并将基础的边界框回归目标替换为距离IoU(DIoU)损失。这些修改提高了对复杂背景中小型或部分遮挡手势的特征区分能力和定位精度。系统的云层负责手势检测、场景理解、多模态融合和动作规划,而TonyPi机器人则在本地处理数据采集、通信、动作执行和反馈。
在公共手势数据集和自定义数据集上的实验结果显示,YOLO-DC的精度值分别为98.9%和95.0%,mAP@0.5值分别为90.7%和92.7%。系统级评估显示单动作、复合动作和依赖视觉的任务的成功率分别为95%、88%和82%。在30名参与者的评估中,整体满意度评分为3.69(满分5分)。这些结果证明了在资源受限的机器人交互中,结合精细的手势检测与多模态代理的可行性。
博主点评: 本文展示了如何在资源有限的条件下,通过云和边缘计算结合多模态技术实现高效的机器人交互。尤其是手势识别的精度大幅提升,表明了深度学习与新型损失函数的结合在实际应用中的潜力。未来的研究可以进一步探索不同环境下的适应性。