NeFut Logo NeFut
EN 管理员登录

[AI学术] 更多选择,更少决策:JEV 类直接决策模型的序数尺度偏差

发布于:2026-10-01 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

直接决策模型将文本映射为低延迟的结构化标签和分数,因而在分类和自动评估中颇具吸引力。然而,可靠性不仅要求高准确率,还要求模型忠实使用用户提供的序数决策尺度。

我们对 JEV 1.13 以及三个开源 KEV 模型进行评估。以 ANLI 为起点,JEV 将 38.8% 的预测和 51.3% 的错误归为 “Neutral”,尽管整体准确率达 74.95%,金标标签和候选位置几乎均衡。

在 36 个序数数据集上,最终决策仅利用了 67%–76% 的有效金标支持,而在四个名义任务上利用率可达 87%–102%。随机打乱候选顺序虽能削弱压缩效应,却未能根除。

固定条目和源分数、平衡金标支持与位置后,我们将尺度 $K$ 从 2 扩展至 14;所有模型的利用率均下降,在 $K=14$ 时仅剩 26%–75%,尽管大多数模型的候选概率分布仍保持宽阔。

针对性 BA‑LoRA 后训练将金标相对利用率从约 47% 提升至 86%,在八个监督尺度上对两种 KEV 大小均有效,表明压缩是可学习且可调的,而非不可变的架构限制。

我们将此现象称为“序数尺度利用偏差”:一种决策阶段的候选空间压缩,独立于准确率、金标不平衡、固定位置或候选数量。

代码与数据已在 https://github.com/Glax147/jev_ordinal_scale_bia 开源。

点评

原文链接: https://arxiv.org/abs/2609.38827

[h] 返回首页