NeFut Logo NeFut
EN 管理员登录

[AI学术] 语音驱动的3D头像渲染:PD-GS算法

发布于:2026-08-07 22:00 最后更新:2026-08-08 01:08
#AI #Machine Learning #LLM

最近的研究提出了一种新的方法,称为语音驱动的3D高斯抛射(PD-GS),用于实现更真实的口型动作。传统的3D高斯抛射(3DGS)方法虽然能够快速渲染出逼真的头像,但在口型动作方面仍然存在一些问题,比如嘴巴运动过于平滑,可能会违反一些口型约束。为了解决这个问题,研究人员提出了PD-GS方法,该方法使用自动语音识别(ASR)和强制对齐管道来获取时间对齐的语音标记,并将其与3DGS模型结合。PD-GS的核心组件是语言融合模块(LFM),它可以自适应地融合连续的音频上下文和离散的语音标记嵌入,从而实现平滑的音频驱动动态和强大的语音引导。实验结果表明,PD-GS在HDTF数据集上实现了最好的唇部几何形状,并在挑战性的语音序列中减少了闭合违反的情况。 博主点评: 本文提出了一种创新性的PD-GS算法,通过融合语音标记和3DGS模型,实现了更真实的口型动作和唇部几何形状。这种方法有望在虚拟头像、语音驱动动画等领域得到应用。

原文链接: https://arxiv.org/abs/2608.05218

[h] 返回首页