摘要
建模多实体时间数据需要捕捉实体、时间及其交互之间的依赖关系。基于变换器的方法表现良好,但通常依赖于深层次的网络堆叠来隐式学习这些异构依赖,增加了计算成本。我们从结构的角度重新审视这个问题,将多实体时间动态分解为三种交互类型:实体之间的空间交互、时间上的时间交互以及耦合这两个领域的交叉交互。
我们提出了一种结构化的时空变换器块,明确建模这三种交互。该模型采用并行的空间和时间自注意力机制,随后是双向交叉注意力,最后通过可学习的门控融合将输出结合起来。通过直接编码这些互补的视图,该模型减少了对深层堆叠的需求。
我们在基于视频的群体活动识别、基于骨架的人类交互分析以及基于可穿戴传感器的活动识别等任务上评估了该方法。尽管其结构简单,单块结构化变换器的性能与更深的架构相当,参数仅为1.76M。结果表明,之前模型中的深度部分弥补了隐式和纠缠的交互建模,而显式的因子化提供了一种更高效、透明的替代方案。更广泛地说,这项工作支持一种结构优先的设计原则:通过暴露交互结构而非依赖深度,富有表现力的多实体时间推理可以得以实现。
博主点评: 本文提出的结构化时空变换器展现了如何通过显式建模交互来简化复杂的多实体推理任务,值得在实际应用中进一步探索其潜力。其在参数效率和计算成本上的优势,或将引领未来变换器架构的设计思路。