我们提出了一个大规模标注偏好数据集 CreativePreferences,包含 280 万篇文本,跨 7 个创意领域,累计 3.17 亿人类偏好判断,并设定了 42 项基准任务。数据标签通过可执行程序、评分标准库以及密集训练模型(分别记为 V、A、VAT)进行建模。实验发现两类系统性差距:可表述性差距(VAT‑VA)和 可验证性差距(VAT‑V)。我们采用一种新颖的测量方法,利用捕获‑重捕获技术发现可表述/可验证度量、剔除伪变量,并估计未被发现度量的价值,从而得到每类差距的上、下界。该差距在所有领域均存在,即使是传统上被视为完全可验证的领域,如数学证明和软件工程,亦不例外;在以正确性为核心的领域以及以主张‑新颖性为核心的新闻、专利、同行评审等也同样出现。差距大小随领域而异,同行评审和创意写作的可表述性差距最大;参与判断的人数越多,差距越宽,这与 Collins 的集体隐性知识理论相符。我们进一步展示了两项重要后果:① 在人类生成任务中,完整模型(VAT)更贴合人类偏好,常常与显式标准产生冲突;② 类比 Goodhart 定律,显式化偏好会将其从隐性维度上推离。基于此,我们给出在何种任务可使用提示、学习机制如何改进以及何时应保留人工判断的建议。
点评