NeFut Logo NeFut
EN 管理员登录

[AI学术] 物理驱动的流体视频生成:模拟数据集与双流光流监督

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#AI #Machine Learning #Open Source

在视频扩散模型中,生成的流体内容往往违反基本物理规律,例如液体在空中破裂、容器内水位不升高等。这一问题源于大型视频文本语料库缺乏明确的运动监督,使得模型学习到的只是流体的外观,而非动态。为了解决这一问题,本文提出了两个关键贡献。

首先,我们构建了一个物理仿真的流体数据集,结合了 1,638 个 MPM 模拟的倾倒/晃动视频与 2,320 个经过关键词过滤的真实倾倒视频,此外还包含两个测试集:一个 1,515 视频的真实视频基准和一个 18 提示文本到第一帧的泛化基准。

其次,我们引入了一种基于预训练扩散变换器视频生成器的双流图像到视频架构。该架构在标准 RGB 解码器的基础上,增加了一个轻量级的光流解码器分支,使用明确的端点误差和平滑损失进行训练,并通过零初始化卷积将其融合到 RGB 流中,以保持预训练主干的稳定性。只有这两个解码器被更新,而编码器、时间变换器和文本编码器保持冻结。

在两个模型规模(1.3B 和 14B)及两个测试集上,我们的方法在 VideoPhy-2 物理常识和视频质量评分上相对于冻结主干提高了最高 8.75 和 4.65 分,超越了一家领先的开放竞争者,并在盲测中获得了人类评审者的偏好。直接的光流读取评估进一步表明,在分布内的端点误差低至 0.54 像素,确认了模型内化了一种一致的运动先验,而不仅仅是改善表面外观。

博主点评: 本文通过结合物理仿真数据集和创新的双流光流架构,显著提升了流体视频生成的物理一致性,展示了深度学习在复杂动态模拟中的潜力。这一研究为未来的视觉生成任务提供了重要的技术基础,值得关注与探讨。

原文链接: https://arxiv.org/abs/2607.25321

[h] 返回首页