NeFut Logo NeFut
EN 管理员登录

[AI学术] 波兰医学视觉问答:视觉语言模型低估视觉证据

发布于:2026-08-14 22:00 最后更新:2026-08-16 07:03
#AI #Machine Learning #VQA

最近的研究引入了一个波兰语医学视觉问答(VQA)基准,来源于波兰医师和牙医的专业认证考试的问题。这个基准包括多个医疗专业和视觉领域的图像问题,以及一个仅包含文本的问题回答(QA)对照集。研究评估了面向波兰语的、通用目的的开源模型和商业视觉语言模型。实验结果表明,任务仍然具有挑战性:最好的模型在整个VQA集上获得了79.0%的准确率,而只有GPT-5.6在有候选回答的子集上超过了人类的参考准确率;其他模型的性能都低于人类。为了评估视觉基础,研究人员比较了完整输入与省略图像、问题或两者的配置,并根据图像重要性对问题进行分类。结果表明,模型从问题文本中获取的信息比从图像中获取的信息更有用,并且在图像主导的问题上表现更差。然而,在QA和VQA任务中,模型仅从答案选项中就能获得超过随机的准确率,表明即使任务的关键组件缺失,非平凡的性能仍然可以持续。 博主点评: 视觉语言模型在医学视觉问答任务中仍然面临挑战,尤其是在利用视觉证据方面存在不足,未来研究需要进一步改进模型的视觉基础能力。

原文链接: https://arxiv.org/abs/2608.12928

[h] 返回首页