NeFut Logo NeFut
EN 管理员登录

[AI学术] 冻结场景、变动赢家:文本到3D评估的配置脆弱性

发布于:2026-10-02 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #Evaluation

本文审视在渲染图像评估中,摄像机设置和标题措辞成为测量协议一部分时,文本到3D排行榜是否会因所有生成场景保持不变而改变。我们在六种生成器的300个冻结场景上,分别变动八个渲染与标题因素,使用19种对齐评估器和一个感知质量对照,随后测试四种针对性的场景退化。

结果显示,17/19的对齐评估器在配置方差上超过生成器间方差,且在11/19的评估器中,prompt‑bootstrap 的下界高于1。排名相较于分数更为稳固,但在某些配置下,18/19的评估器会改变点估计的冠军。我们通过成对协议边际包络来判断比较方向在所有设置下是否保持一致。虽然部分配对的区间相互对立,但在对全局搜索进行同步推断后,没有出现方向逆转的情况。因此观察到的冠军变动属于描述性现象,而非生成器优劣的确认性变化。

敏感度仍然独立:即使是无提示的对照,在布局扰动上的方向判别率(考虑平局调整后)也未超过67%,该扰动仅为诊断性而非经人类验证的真值。审计工作将分数稳定性、决策不确定性和针对性敏感度区分开来,并建议在报告时提供(生成器、分数、卡片ID),并附带基于协议的比较和考虑选择不确定性的说明。

点评

原文链接: https://arxiv.org/abs/2610.00447

[h] 返回首页