可控的外科手术世界模型可以为外科人工智能和模拟提供生成基础,通过合成真实的仪器-组织相互作用。然而,现有的方法缺乏统一的多模态控制范式,而直接融合异构的视觉条件往往会导致解剖学失真、仪器外观漂移和时间不一致的相互作用。在这项工作中,我们提出了 {Surg-UniWorld},一个具有多模态控制专家的统一外科手术世界模型。Surg-UniWorld 首先从第一帧外观和分层语义掩膜中构建一个 {分层外科锚点},以保持持续的场景身份、解剖学组织和交互边界。然后,{锚点相对模态专家} 相对于共享的锚点解释边缘、深度和光流证据,捕获互补的边界、几何和运动信息。一个 {多模态控制专家} 进一步执行激活模态增量的贡献保留阶段组合,并为 Wan2.2 视频扩散骨架生成控制提示。为了支持多模态外科手术世界建模,我们进一步构建了 Cholec80-SurgWAM,这是一个可控的外科手术视频生成基准。大量的实验表明,Surg-UniWorld 在生成质量、时间一致性和多模态可控性方面始终优于现有的可控视频生成方法和外科手术世界模型基准。 博主点评: 本文提出了一种创新的外科手术世界模型,实现了多模态控制和高质量的视频生成,具有广阔的应用前景和研究价值。