NeFut Logo NeFut
EN 管理员登录

[AI学术] 基于面部关键点的3D高斯点云驱动的说话头合成

发布于:2026-09-17 22:00 最后更新:2026-09-18 00:46
#AI #Machine Learning #Neural

音频驱动的数字人生成在虚拟交流、沉浸式交互和媒体制作中扮演关键角色。随着神经辐射场(NeRF)和3D高斯点云(3DGS)技术的进步,近期的说话头系统在3D面部几何和外观建模上取得更高保真度。然而,语音特征主要描述时序声学模式,缺乏明确的面部布局信息,直接用音频驱动3D面部变形往往导致嘴部运动不准、表情细节弱和局部伪影。为此我们提出了面部关键点引导的空间增强模块。预测的关键点为在表情敏感区域周围选择并丰富空间点提供结构线索。进一步引入全局关键点补偿机制,将完整关键点集合编码为条件向量,以细化3DGS属性。该补偿为底层形状表示注入全脸结构信息。自驱动和跨驱动实验表明,本文方法在视觉质量、面部真实感和唇形同步方面均有提升。

点评

原文链接: https://arxiv.org/abs/2609.17422

[h] 返回首页