NeFut Logo NeFut
EN 管理员登录

[AI学术] 图表欺骗:视觉语言模型的脆弱性与缓解策略

发布于:2026-07-28 22:00 最后更新:2026-07-29 01:08
#algorithm #AI #Open Source

在数据分析中,信息可视化被广泛用于传达模式、趋势和异常值。然而,误导性的设计选择(如截断或反转轴、扭曲的纵横比、不当编码以及误导性的颜色映射)可能会系统性地改变对数据的解读,尽管底层数据保持不变。

随着视觉语言模型(VLMs)在图表理解和分析推理中的应用日益增加,评估它们对这些误导性可视化的鲁棒性变得至关重要。

我们引入了VisDeception,这是第一个用于评估VLMs对误导性图表设计鲁棒性的受控配对基准。该基准包含1600对忠实和误导性图表,涵盖八大类欺骗性可视化策略,其中每个误导性图表都与从相同底层数据生成的忠实对应图表配对。

为了从基线图表理解错误中孤立出由欺骗引起的推理错误,我们引入了欺骗评分(Deception Score),这是一种配对评估指标,量化误导性可视化如何使模型的响应偏离数据的忠实解读。

通过对10个最先进的VLMs的32000个响应进行分析,我们发现即使是高级模型也对误导性视觉操控高度脆弱。为了提高鲁棒性,我们进一步提出了一种推理时的多代理缓解框架,该框架在生成答案之前基于从可视化中提取的结构化图表元数据来支持推理,从而使模型能够减少误导性视觉线索的影响,而无需明确的用户指令。

我们发现,这些结果揭示了当前图表理解系统中存在的重要可靠性差距,并确立了基准驱动的评估、关注欺骗的指标和结构化推理作为开发更可信的VLMs进行视觉分析的有希望的方向。

博主点评: 本文深入探讨了视觉语言模型在面对设计不当的图表时的脆弱性,并提出了创新的评估与缓解方案。通过引入欺骗评分和结构化推理框架,研究为提升模型的可靠性提供了新的思路,值得在实际应用中进一步探索和验证。

原文链接: https://arxiv.org/abs/2607.22600

[h] 返回首页