NeFut Logo NeFut
EN 管理员登录

[AI学术] 正确的顺序,错误的尺度:审计LLM评审员用于职业AI测量

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

LLM 评审员正被用于判断 AI 输出是否符合工作场景的要求。仅有响应排序的一致性并不能保证对接受率或职业层面聚合结果的可靠性。我们基于 45,796 条工人评分构建了 O*NET‑BENCH 审计套件,并在 4,501 条测试评分上评估了 33 种已有的评审配置,覆盖六大模型族。

其中 25 种配置的 tie‑aware 对偶准确率达到 0.60 以上,但一个仅使用响应文本的 TF‑IDF 基线几乎可以匹配最强评审员的表现。尽管排序一致,评审员对可接受响应的估计范围为 3.0%‑97.9%,而职业匹配的工人给出的比例为 61.1%。

在一个微调系列中,将点式打分改为少样本/列表式协议提升了排序质量,却降低了与工人在任务和职业层面的均值一致性;该逆转在任务和工人完全不重叠的验证集上同样出现,满足预设标准。

交叉验证校准能够基本消除均值偏差,但校准后的分数最多只能解释 8.5% 的个人工人评分方差。基于预测的估计在我们考察的标签预算下仅带来极小的精度提升。

这些结果表明,仅凭排序一致性不足以进行职业层面的测量。评审员必须在接受率和其分数将用于估计的聚合指标上进行验证。

点评

原文链接: https://arxiv.org/abs/2610.02492

[h] 返回首页