摘要
脑电图(EEG)到图像的评估应区分视觉保真度与可恢复的意义。然而,EEG衍生的重建图像通常模糊、失真且细节不足,导致 SSIM、LPIPS 和 CLIP 等指标惩罚语义可恢复的输出,或奖励似是而非的结果。
我们分析了来自 ATM、ENIGMA、BrainVis 和 DreamDiffusion 的 6,855 对真实/重建图像,采用语义探测、描述严苛度和盲点率,以及控制降解的方法。
像素指标显示与语义一致性几乎没有相关性,而表示指标则混淆了感知与语义错误。因此,我们引入了一种脑机接口(BCI)感知的框架,其中四个 VLM 通过结构化问题评估图像对,生成宽容感知对齐分数(T-PAS)和宽容语义对齐分数(T-SAS)。
他们的共识被提炼为脑机接口一致性分数(BCS),这是一个紧凑的评估器,在我们的数据上实现了 T-PAS MAE 为 0.079(r = 0.700)和 T-SAS MAE 为 0.082(r = 0.850)。人类验证显示高度可靠的联合一致性判断,Cohen's kappa = 0.882 ± 0.174 和 Krippendorff's alpha = 0.882,支持感知-语义的可恢复性优于通用的视觉相似性。代码和资源可在 BCS GitHub 上获取。
博主点评: 该研究提出了一种新颖的框架,利用视觉语言模型(VLM)来提升脑电图到图像重建的质量,强调了语义一致性的重要性,尤其在视觉质量评价中。这为未来的脑机接口应用提供了重要的理论基础与实践指导。