外科手术通常遵循“阶段‑步骤”层次结构,但现有视频‑语言模型的评估仅使用平面指标,忽视了跨层次的一致性和错误结构。为此我们提出两项工作:第一,SurgHiBench——首个层次感知的外科视频评估套件,包含识别、连贯性和错误严重度三个任务,分别在不同粒度层次上衡量模型表现。第二,HyperSurg——一种基于双曲空间的模型,利用蕴含锥强制阶段包含步骤的关系,在四个公开数据集(覆盖三类手术)上进行实验。我们对比了通用 CLIP、欧氏空间外科模型以及 HyperSurg。评估结果显示,准确率相同的模型在错误严重度上差异显著:有的模型仅在同一阶段的兄弟步骤间混淆,而有的则产生跨阶段的错误预测。双曲几何能够将预测拉向正确的手术邻域,且其提升幅度随数据集标注层次的树形程度增加,提供了层次感知几何何时有益的理论依据。
点评