LLM‑as‑a‑Judge(LLM 充当评审者)的流水线正被广泛用于评估 AI 生成的文本,核心假设是模型会依据评分标准(rubric)对候选答案进行推理并给出判断。我们对这一假设进行深入检验,发现评分标准本身蕴含可恢复的评估信号。
实验中,仅使用评分标准文本训练的分类器(不接触任何被评答案)即可在预测评审输出上取得显著的非随机性能,这表明分数在一定程度上可以独立于模型输出被预估。
进一步的反事实扰动实验显示,当候选答案或评分标准条目被颠倒时,LLM 评审往往未能可靠地更新其判断,出现决策不变或错误的情况。
这些结果对基于评分标准的 LLM 自动评估的可靠性提出了质疑,强调需要对 LLM 驱动的评估方法进行更系统的理论与实验研究。
点评