NeFut Logo NeFut
EN 管理员登录

[AI学术] 评估 LLM 作为评审者:关于基于评分标准的自动文本生成评估的漏洞

发布于:2026-09-05 22:00 最后更新:2026-09-06 01:02
#AI #Machine Learning #LLM

LLM‑as‑a‑Judge(LLM 充当评审者)的流水线正被广泛用于评估 AI 生成的文本,核心假设是模型会依据评分标准(rubric)对候选答案进行推理并给出判断。我们对这一假设进行深入检验,发现评分标准本身蕴含可恢复的评估信号。

实验中,仅使用评分标准文本训练的分类器(不接触任何被评答案)即可在预测评审输出上取得显著的非随机性能,这表明分数在一定程度上可以独立于模型输出被预估。

进一步的反事实扰动实验显示,当候选答案或评分标准条目被颠倒时,LLM 评审往往未能可靠地更新其判断,出现决策不变或错误的情况。

这些结果对基于评分标准的 LLM 自动评估的可靠性提出了质疑,强调需要对 LLM 驱动的评估方法进行更系统的理论与实验研究。

点评

原文链接: https://arxiv.org/abs/2609.02942

[h] 返回首页