NeFut Logo NeFut
EN 管理员登录

[AI学术] StreamHOI:交互感知的时间记忆适应框架,打造流媒体人机交互视频生成

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#algorithm #AI #Machine Learning

摘要

现有的人机交互(HOI)视频生成方法大多局限于离线短视频生成,并且在复杂的驱动条件下表现不佳,因而不适合实时交互应用。我们提出了 StreamHOI,一个低延迟的流媒体框架,用于长时间HOI视频生成。

关键技术

StreamHOI的创新在于如何组织历史记忆,以在有限延迟内保持交互。我们发现,标准的sink-local记忆设计在流媒体HOI生成中面临权衡,而不同的transformer模块对于HOI区域及其周边区域的历史记忆偏好各异。

为此,StreamHOI采用离线HOI感知块分析,并应用偏置引导的记忆专用训练,来适应生成器的块特定记忆布局。此外,我们引入了记忆距离缩放模块,以增强对早期交互状态的长程访问能力。

性能表现

与长视频基线及近期HOI生成方法的广泛比较表明,StreamHOI在交互可信度、物体真实度、人类质量和效率方面表现出色,达到了17.6 FPS的速度,且首个数据块延迟为0.75秒。

博主点评: StreamHOI在处理流媒体HOI视频生成时,通过优化记忆组织和模块适配,显著提升了交互质量和生成效率,其独特的方法论为实时视频生成提供了新的思路,值得深入研究和应用。

原文链接: https://arxiv.org/abs/2607.20174

[h] 返回首页