近年来,大型语言模型(LLM)已成为模型评估、在线评分和奖励建模的关键基础设施。通常,评判者的有效性通过其在高质量数据上的准确率来验证,但准确率并不能反映出评判者在重复提示、挑战或持续反对面前的稳定性。为此,我们引入了 Wiggle Framework ,一个用于评估LLM评判者认识稳定性的统一压力测试框架。该框架从三个维度来分析评判者的稳定性:机械一致性(在重复提示和重新表述下面的稳定性)、单回合信念(在单次挑战下的稳定性)以及多回合坚持(在持续或适应性压力下的稳定性)。我们利用该框架来研究9个前沿模型在14个评判任务中的表现,涵盖安全性、有毒性、AI写作检测和政治响应评估等方面。结果表明,每个模型作为评判者都表现出显著的摇摆性——在静态压力下25-71%的时间内改变判决,在使用对抗LLM说服者的情况下62-91%的时间内改变判决。关键发现是,成功改变评判者判决的压力几乎总是相对于真实情况有腐蚀作用。除了框架本身,我们还发现基准陪审团多数的力量是预测哪些项目会摇摆的最有效的单次信号。总的来说,这是第一次在评判背景下对机械、顺从和说服力测试进行的跨数据集的比较。 博主点评: 本文引入的Wiggle Framework为评估LLM评判者的稳定性提供了一个有力的工具,揭示了当前模型在面对压力和挑战时的脆弱性。这种评估对于提高LLM在实践中的可靠性和安全性具有重要意义。