视频异常检测(VAD)旨在识别异常事件并定位其时间间隔。现有方法存在“何时-何事”分离的问题:传统的基于深度神经网络(DNN)的方法可以定位异常发生的时间,但缺乏语义理解;而基于大型语言模型(LLM)的方法可以解释发生了什么,但忽略了精确的时间定位。我们认为这是由于缺乏统一的推理范式。受到人类检查监控视频的方式启发——从整体上浏览以形成时间假设,检查可疑段,并迭代思考以纠正错误——我们从两个角度研究这种全局到局部的范式。 首先,我们提出了一种名为“Glance then Scrutinize”(GtS)的无需训练的框架,使用静态和动态文本指导来进行粗到细的异常定位和理解,平衡准确性和速度。为了突破外部模块固定的限制,我们进一步提出了一种增强型智能的VAD方法,其中一个多模态的大型语言模型学会调用视频剪辑工具,检查密集重采样的帧,并自我纠正误定位的假设,通过冷启动监督微调后接着使用具有联合答案-定位奖励的强化学习。 对于训练和评估,我们将之前的VAGU基准扩展为VAGU-T(视频异常定位、理解和思考),包括21个异常类别的7,567个真实世界视频,具有人工验证的定位、解释、问答对和工具调用链。我们还引入了JeAUG,一种同时评估语义可解释性和时间精度的度量。 实验表明,GtS大大超过了无需训练的基线模型,而智能模型既提供更高的准确率,又实现了更快的推理。 博主点评: 视频异常检测领域的新进展为我们带来了从无需训练到智能推理的范式转变,开启了更加准确和高效的异常检测新时代。