最近的研究提出了一种新的方法,称为语音驱动的3D高斯抛射(PD-GS),用于实现更真实的口型动作。传统的3D高斯抛射(3DGS)方法虽然能够快速渲染出逼真的头像,但在口型动作方面仍然存在一些问题,比如嘴巴运动过于平滑,可能会违反一些口型约束。为了解决这个问题,研究人员提出了PD-GS方法,该方法使用自动语音识别(ASR)和强制对齐管道来获取时间对齐的语音标记,并将其与3DGS模型结合。PD-GS的核心组件是语言融合模块(LFM),它可以自适应地融合连续的音频上下文和离散的语音标记嵌入,从而实现平滑的音频驱动动态和强大的语音引导。实验结果表明,PD-GS在HDTF数据集上实现了最好的唇部几何形状,并在挑战性的语音序列中减少了闭合违反的情况。 博主点评: 本文提出了一种创新性的PD-GS算法,通过融合语音标记和3DGS模型,实现了更真实的口型动作和唇部几何形状。这种方法有望在虚拟头像、语音驱动动画等领域得到应用。