LLM 作为评审者已经成为大规模、主观评估的事实标准。然而,现有排行榜通过不断增加比较次数来补偿系统性测量偏差,这既在统计上不可靠,又在计算上浪费资源。根本原因在于测量模型不完整,错误地将 LLM 评审者视为中立、可互换的仪器,忽视了已被记录的偏差,包括位置偏差、冗长偏差、评审严苛度以及自我提升效应,这些偏差无法通过增加数据量来消除。
我们提出一种统一的潜变量框架,能够同时建模成对比较和序数数据,并显式校正上述混杂因素。该模型在显著减少比较次数的前提下,恢复出可靠的排名。由于模型拟合的计算成本相对于一次 LLM 推理几乎可以忽略不计,偏差校正不仅在统计上更为严谨,也是一种更可持续的可信评估方式。
点评