NeFut Logo NeFut
EN 管理员登录

[AI学术] 反复提问:评估视觉语言模型的稳定性

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#algorithm #AI #Machine Learning

在实际应用中,视觉语言模型(VLMs)不仅需要强大的视觉推理能力,还需在持续的对话压力下保持稳定。我们提出了“反复提问”(JKP)这一多轮评估框架,用于测量VLM在用户反复挑战、质疑或否定模型答案时的知识稳定性。JKP使用三种策略对模型进行最多10轮的跟进提问:对抗性否定(反复拒绝)、纯苏格拉底式询问(反复要求重新评估确定性)和上下文感知的苏格拉底式总结(在请求重新考虑前反映模型的先前推理)。

我们在STAR基准的一个子集上对GPT-4o、Gemini 2.5 Pro和Qwen3-VL-30B进行了720次多轮评估。整体准确率从第0轮到第10轮变化不大,但轨迹级分析显示出显著的不稳定性:正确答案回归,错误答案恢复,许多运行表现出答案反复波动。反复提问的效果有限,常常作为不稳定因素而非推理辅助。该效应强烈依赖于模型:Qwen3-VL-30B在最终准确率上最高,但在直接矛盾下变得自信而错误;Gemini 2.5 Pro相对稳定但代价高昂;GPT-4o则显得最脆弱且波动性大。这些发现表明,多轮VLM评估不仅捕捉到额外的推理能力,还反映了模型在反复挑战下的压力响应特征:即模型如何在视觉基础、校准和对话合规性之间进行权衡。

博主点评: 本研究揭示了VLM在面对持续质疑时的复杂反应,强调了模型之间的差异,尤其是在稳定性和准确性方面。这为未来VLM的设计和评估提供了重要的参考,提示我们在实际应用中需谨慎处理多轮对话的挑战。

原文链接: https://arxiv.org/abs/2607.14099

[h] 返回首页