近期的文本到视频(T2V)生成模型使得假新闻视频可以从头开始合成,这使得威胁超出了廉价的、由现有片段组成的假视频。这些新闻视频可以与编造的叙述紧密匹配,导致现有的检测器陷入模态对齐陷阱。现有的数据集缺乏纯合成的假新闻视频。虽然直接使用T2V模型可以生成完美对齐的样本,但这会使假新闻视频检测(FNVD)简化为单模态捷径,并导致语义-视觉退化。为了应对这一问题,我们将T2V-FNVD表述为一个新的三元分类任务,包括三个标签(真实、廉价假和纯合成假),并构建了第一个纯合成假新闻视频数据集(PS-FNVD)。PS-FNVD包括具有对齐欺骗的捏造事件(类型1)和具有错误视觉来源的真实事件(类型2),这可以防止模型利用单模态捷径。此外,我们提出了推理引导的T2V-FNVD(R-T2V)框架。通过条件推理生成和监督微调,R-T2V将高层语义逻辑与低层物理生成跟踪相结合,以预测三元真值标签。大量实验表明,R-T2V在10个主流基线上取得了最先进的性能,相对于第二好的基线,其准确率提高了12.20个百分点,宏$F_1$提高了8.46个百分点。 博主点评: 本文提出了一种新颖的方法,用于检测基于文本到视频的假新闻视频,通过构建纯合成假新闻视频数据集和提出推理引导的框架,取得了最先进的性能,这对应对新时代的假新闻视频威胁具有重要意义。