现代文本到图像(T2I)模型的整体得分往往相近,却在不同能力上表现各异,导致实际选型困难。细粒度基准通常把提示拆解为若干问题,但随后又把这些问题映射回整体提示得分或固定类别,削弱了归因能力并忽视了问题的复杂度。相关需求也常被单独计分或合并为一个总分,导致基本实现错误与组合错误难以区分。
我们提出 QC‑T2I‑Bench,这是一套面向问题的框架。它将开放式提示转化为具备属性的原子问题,并使用 Davidsonian 场景图(DSG)组织问题之间的依赖关系。通过层级约束的聚合策略,若前置问题未通过,则自动剔除其后续问题;同时避免简单提示与复杂提示获得相同的总权重。
利用 DSG 的结构,我们能够在同一提示内部度量联合成功率,并在不同提示之间比较重复实体的表现,从而将基本实现失误与在附加需求下的失误分离。我们在英文和中文提示上评估了多款开源 T2I 模型。实验显示,具备两项能力的组件的联合完成率为 80.7%,而具备七项以上能力的组件下降至 37.2%。
最后,我们复用同一批记录实现了无训练路由器。该成本感知路由器在 GPU‑s/MP 指标上比 ERNIE 低 21.3%,却仍能匹配其 89.51 分的估计值。
博主点评:QC‑T2I‑Bench 通过问题层面的细化与依赖图的引入,为 T2I 模型的选型与诊断提供了更透明的依据,同时兼顾了计算成本,是实用性与学术价值兼备的创新工作。