摘要
近年来,3D生成技术的进步使得视觉合成变得令人印象深刻,但现有方法通常依赖于2D扩散监督,缺乏明确的几何一致性机制,导致空间幻觉,如结构重复和几何错位。这些问题在4D生成中更为严重,因为在不同视点和时间演变中保持一致性带来了额外挑战,包括抖动、身份闪烁和结构漂移。
我们提出了Hallo4D,这是一个统一的、模型无关的框架,旨在减轻3D和4D内容生成中的时空幻觉。Hallo4D引入了一种生成-检测-修正范式,利用大型多模态语言模型(LMMs)识别和总结来自多视角和多帧渲染的空间和时间不一致性。这些见解指导了一种共识驱动的图像空间一致性优化,LMM驱动的选择器通过多模型投票评估候选修正,无需重新训练或架构修改。
为了进一步提高时间一致性和优化效率,Hallo4D结合了运动感知关键帧采样、LMM引导初始化和外观对齐。我们还引入了曝光感知优化和可见性修剪,以增强在挑战性视角下的鲁棒性。广泛的实验表明,Hallo4D在各种3D和4D生成设置中始终优于强基线,提供了一种可扩展且具有普适性的时空一致性内容生成解决方案。
博主点评: Hallo4D通过引入多模态语言模型,有效解决了3D和4D生成中的一致性问题,展示了强大的技术潜力与应用前景。这一框架不仅提升了生成质量,也为未来的研究提供了新的思路。利用共识驱动的方法,Hallo4D在复杂的生成任务中展现了其优越性,值得深入探索与应用。