摘要
视觉模型是否像人类一样感知颜色?现有的色彩表现评估通常将其与几何空间(如 CIELAB)或离散色彩标签进行比较。这些参考可以捕捉感知距离或类别归属,但无法体现人们组织颜色的细致方式。
我们针对一个模糊感知模型评估色彩基础,该模型包含86个基于人类调查数据拟合的分级类别。该框架可以应用于任何图像编码器,并测量三个互补属性:类别边界、类别紧凑性以及超越色彩几何的分级一致性。
在十一种视觉变换器编码器中,类别级结果大体相似,而分级一致性差异显著。掩码自编码器(MAE)在超越几何的一致性上表现最佳,其置信区间与其他编码器不重叠。逐层分析进一步表明,掩码重构在输出时保留了这一结构。
在自然图像上,MAE在全局范围内表现表面颜色,而语言监督模型则更强烈地与前景对象相关联。这些结果表明,人类色彩基础具有多个独特方面,不应简化为单一评分。
博主点评: 此研究深入探讨了视觉模型与人类色彩感知的差异,强调了多维度评估的重要性。通过引入模糊感知模型,研究者们为未来的视觉系统设计提供了新的视角,推动了计算机视觉领域的进步。