现有道路旁交通数据集主要用于感知、预测和视觉问答,但未评估反事实视频生成,即在修改选定行为体后,生成的未来帧仍需符合道路拓扑和其他交通。为此我们推出 TrafficImag,首个面向反事实道路旁交通视频生成的基准。TrafficImag 包含 9,022 张标注图像、7,043 条去重视频片段、31,145 条以行为体为中心的历史‑未来样本,并提供可执行协议,支持行为推理、干预感知图像编辑和条件视频生成。每一次干预以行为体级程序描述:目标行为体、期望行为、合法路径、交互顺序和时间约束,从而在异构基础模型间提供统一评估接口。评估维度包括初始状态正确性、路径与行为有效性、交互一致性以及非目标保持,只有四者全部满足才算端到端成功。实验表明,最强推理模型的宏观 F1 达 80.4%,完整条件接口将最佳生成模型的成功率从 23.3% 提升至 55.0%。Oracle 实验进一步指出,条件视频执行仍是主要瓶颈。TrafficImag 为超越感知质量的反事实交通视频生成提供可复现的评估平台。
点评