直接决策模型将文本映射为低延迟的结构化标签和分数,因而在分类和自动评估中颇具吸引力。然而,可靠性不仅要求高准确率,还要求模型忠实使用用户提供的序数决策尺度。
我们对 JEV 1.13 以及三个开源 KEV 模型进行评估。以 ANLI 为起点,JEV 将 38.8% 的预测和 51.3% 的错误归为 “Neutral”,尽管整体准确率达 74.95%,金标标签和候选位置几乎均衡。
在 36 个序数数据集上,最终决策仅利用了 67%–76% 的有效金标支持,而在四个名义任务上利用率可达 87%–102%。随机打乱候选顺序虽能削弱压缩效应,却未能根除。
固定条目和源分数、平衡金标支持与位置后,我们将尺度 $K$ 从 2 扩展至 14;所有模型的利用率均下降,在 $K=14$ 时仅剩 26%–75%,尽管大多数模型的候选概率分布仍保持宽阔。
针对性 BA‑LoRA 后训练将金标相对利用率从约 47% 提升至 86%,在八个监督尺度上对两种 KEV 大小均有效,表明压缩是可学习且可调的,而非不可变的架构限制。
我们将此现象称为“序数尺度利用偏差”:一种决策阶段的候选空间压缩,独立于准确率、金标不平衡、固定位置或候选数量。
代码与数据已在 https://github.com/Glax147/jev_ordinal_scale_bia 开源。
点评