聚合异构视觉语言模型(VLM)能够提升多模态推理,但单个模型的置信度或聚合答案的置信度无法在系统层面衡量可靠性。为此我们提出 CUSP(通过语义意见池化的集体不确定性),它是一种无需训练的不确定性量化框架。CUSP 将多个 VLM 的输出映射到共享的语义响应空间,随后对这些语义响应进行池化,得到一个 pooled semantic opinion,并输出两类互补的系统级信号:集体不确定性——池化意见的离散程度,以及 Jensen‑Shannon 散度(JSD)——模型层面意见之间的冲突。在该 pooled opinion 中,未归一化的集体熵可精确分解为模型个体语义熵的均值与 JSD 的和,即 $$H_{collective}=\frac{1}{M}\sum_{i=1}^{M} H_i + D_{JS}$$,从而将总体离散度与模型冲突分离。CUSP 不依赖 token logits 或校准标签,因而可直接用于开源权重模型和商业 VLM。实验表明,在静态多 VLM 集成中,集体不确定性在小模型 regime 下是最强信号(AUROC 0.764,AUARC 0.889),相较于多数投票和朴素选择提升 4.7‑15.8 个点,且随集成规模扩大优势扩大;在商业模型 regime 中,JSD 表现最佳(AUROC 0.819,AUARC 0.910),并能以最高 0.982 的 AUROC 排序硬答案冲突。池化预测的准确率比单模型平均提升 5.6‑13.0 个点。对多步多代理系统的完整轨迹评估显示,子代理的集体不确定性能够以 0.619 AUROC 区分系统失效,并在所有信号中以 0.699 AUARC 获得最佳的弃权排序。
点评