NeFut Logo NeFut
EN 管理员登录

[AI学术] StateSight:视觉语言模型的潜在空间状态重建基准

发布于:2026-08-24 22:00 最后更新:2026-08-29 12:04
#algorithm #Machine Learning #GPT

Vision‑Language 模型在多模态问答中应用日益广泛,但从单张图像中恢复潜在空间结构的能力仍难以单独评估。传统基准往往把感知、光学字符识别、领域知识、语言先验和推理混合在一起,导致结果难以解释。

我们推出 StateSight,一个程序化生成的基准,包含三类任务:立方体网络对面推理、被遮挡的立方体塔计数以及四邻域连通分量计数。每类任务提供 300 条单图像提示,配有确定性的真值标签,采用精确匹配计分。

在公开评测中,OpenAI 的 GPT‑5.5(模型标识 gpt-5.5)在三项任务上的准确率分别为 59.3%、33.3% 和 28.3%;Claude Sonnet 5 的表现为 53.3%、18.7% 和 7.3%。所有直接调用的实验均未出现格式错误。我们还组织了 30 名参与者的人类基线实验,对 60 条样本进行评测,平均准确率分别达到 80.8%、68.8% 和 64.3%,均高于两款模型。

通过可视化推导分析,发现模型常出现图像状态重建错误和推理过程失误。为进一步研究,我们提供了 StateSight‑Steps,一个配套数据集,包含 900 条交叉的图文示例和 3,600 条确定性的中间视觉状态。实验结果表明,即使响应格式符合要求,也可能掩盖模型在恢复空间结构以进行可验证视觉推理方面的失败。

博主点评:StateSight 有效拆解了视觉语言模型的空间推理能力,为后续模型改进提供了清晰的方向。未来工作可以结合更丰富的几何变体,进一步检验模型的通用空间理解水平。

原文链接: https://arxiv.org/abs/2608.20414

[h] 返回首页