我们提出了 LoG‑VGGT,一个面向长序列 3D 重建的内存高效框架。该框架在局部时间建模与全局相机一致性之间取得平衡。\
传统方法依赖全局注意力,导致显存占用随序列长度线性增长。LoG‑VGGT 在少量 Transformer 块中引入跨窗口注意力,仅在相邻时间窗口之间传播信息,从而在保持显存有界的同时实现有效信息交互。\
为抑制长期姿态漂移,我们设计了全局相机一致性精炼模块。相机 token 与紧凑的 register token 通过跨注意力交互,施加场景级约束,覆盖整个序列。该机制实现了相机表示的联合优化,大幅提升了长时程姿态的稳定性,而无需昂贵的序列级注意力。\
在多个长序列基准上,LoG‑VGGT 显著提升了深度估计精度和相机姿态鲁棒性,并在流式重建任务中保持竞争性能。\
点评