随着视觉语言模型在图像理解、跨模态推理和复杂指令执行方面快速进步,指令遵循能力已成为衡量其可靠性和实用性的关键指标。然而现有的多模态指令遵循基准在语言覆盖范围和对抗安全场景上仍然不足,难以评估真实的多语言和安全敏感环境。为弥补这些缺陷,我们推出 MM-IFEval-Pro,它同时覆盖中文和英文任务,并加入多样的指令劫持案例。MM-IFEval-Pro 包含 4 大任务类、24 个子类以及 8 种指令类、52 个子类,每条样本平均包含 3.0 条约束,以逼真模拟复杂指令场景。我们进一步构建了一个强化学习训练集,加入中文和对抗指令,实验表明该训练集显著提升模型在 MM-IFEval-Pro 上的表现,并能有效迁移至其他主流多模态基准,展示出跨任务和跨语言的强泛化能力。
点评