NeFut Logo NeFut
EN 管理员登录

[AI学术] 程序蒸馏:高效可扩展的自动评估新方案

发布于:2026-07-28 22:00 最后更新:2026-07-29 01:08
#algorithm #C++ #Open Source

在自动评估中,基于LLM(大型语言模型)的评判者已成为标准,但其高成本、显著延迟和不透明的决策限制了其可扩展性和可靠性。为了解决这些问题,本文提出了一种简单而高效的替代方案:程序蒸馏。

与其在评估时调用LLM,不如将其决策逻辑蒸馏为一组程序,这些程序可以直接对候选者进行评分。这种程序化的评判者提供了透明性,易于检查或编辑,并消除了每个样本的API费用。基于这一概念,我们引入了PAJAMA系统,它合成程序作为评判者,将它们的决策汇总为联合裁决,并引入回退机制,以选择性地将低置信度案例上报给LLM。

在五个数据集和四个模型系列的实验中,我们证明了程序化评判者的性能可以匹配一个13B参数的LLM评判者。当使用程序输出作为路由信号时,PAJAMA在准确性和吞吐量上都有所提升,并推动了Pareto前沿的发展。除了评估,程序化评判者还可以产生廉价而有效的奖励信号:在RewardBench上,由程序裁决蒸馏出的奖励模型在API成本低两个数量级的情况下,超越了基于专有LLM标签训练的模型。

博主点评: 本文提出的程序蒸馏方法为自动评估提供了新的思路,尤其是在降低成本和提高透明度方面具有显著优势。PAJAMA系统的设计显示了程序化评判者在实际应用中的潜力,值得关注和深入研究。

原文链接: https://arxiv.org/abs/2607.22561

[h] 返回首页