在本文中,我们探讨了人类如何从复杂的视觉输入中快速识别日常活动。我们使用了 MoVi 数据集中的 16 种日常活动视频,比较了三种运动分析策略:
- 时间运动原语 (TMPs):将运动分解为平滑基函数的加权和。
- 勒让德多项式系数:将关节坐标轨迹投影到正交多项式基上。
- 自编码器潜在嵌入。
结果显示,勒让德系数和 TMPs 的分类准确率最高,其次是自编码器。我们发现了运动分类的两个关键特征:
- 一般姿态:身体的平均空间配置,可以区分不同的活动。
- 9个关键关节:这些关节对于运动分类最具预测性。
有趣的是,良好的分类准确率并不意味着能够良好地重建运动。在重建运动方面,TMPs 保留了时间动态,产生了感知上自然的运动;而勒让德系数的重建仅保留了平均姿态,显得僵硬。
这些结果揭示了运动信息的组织方式:静态的身体配置足以分类活动,但重建运动的展开则需要时间动态。这一区别阐明了视觉系统可能依赖的特征,表明姿态特征在临床应用中可以实现高效的运动筛查,而动态信息在运动生成时至关重要。
博主点评: 本文通过比较不同运动分析策略,深入探讨了姿态与动态在运动分类与重建中的不同作用,为运动识别与生成提供了重要的理论基础,具有广泛的应用前景。