摘要
多模态大语言模型(MLLMs)在基准测试中取得了显著进展,但它们在现实世界中的有效性仍然不确定。这一差距源于基准测试在受控、静态环境与现实应用的动态、交互和情境化特征之间的根本不匹配。为了解决这一问题,我们提出了CEDI(Contextualized Evaluations of MLLMs through Dynamic, multi-round Interactions),一个将评估重新构造成评估模型、自动考官和评分者之间三方交互的框架。
考官通过基于图的任务表示进行多轮半结构化对话。通过导航状态空间的转变,CEDI采用各种策略,从澄清请求到对抗性探测,以引出性能证据。我们将CEDI应用于视觉幻觉的评估。实证结果显示,在多个模型、不同环境、数据集和领域中,情境化的交互评估不仅揭示了显著更多的幻觉,还更贴近实际使用场景中的幻觉。
此外,我们进一步展示了幻觉往往在长上下文中积累,通过自我强化的对话历史,模型在需要拒绝或否定前提的问题上尤其脆弱。这些发现突显了CEDI作为实现对MLLMs能力的现实、系统和生态有效评估的一个重要步骤。
代码可在 GitHub 获取。
博主点评: CEDI框架的提出为多模态大语言模型的评估带来了新的视角,通过动态交互的方式,能够更真实地反映模型在实际应用中的表现。这种方法有效弥补了传统静态评估的不足,值得在更广泛的研究中推广应用。