NeFut Logo NeFut
EN 管理员登录

[AI学术] 超越聚合得分:评估基于参考的自动评估方法的行为正确性假设

发布于:2026-09-08 22:00 最后更新:2026-09-09 09:08
#Machine Learning #LLM #Artificial Intelligence

自动参考评估在自然语言生成系统的质量衡量中占据核心位置。现有的元评估主要关注与人工判断或基准标签的一致性,却难以揭示评估器在受控条件下的行为细节。

为弥补这一缺口,我们提出行为正确性假设框架,作为对参考式自动评估方法的补充诊断手段。框架将假设分为两大类:保持正确性的假设和改变正确性的假设,并通过受控的响应变换来具体化每一假设,明确在特定变换下评估器应呈现的得分趋势。

受控响应变换包括词汇替换、字符扰动、语义重写等操作,每种变换对应一套预期的评分行为。例如,在词汇替换保持语义不变的情况下,保持正确性假设要求评估器的得分基本不变;而在语义削弱的变换下,改变正确性假设则预期得分下降。

我们在实验中覆盖了词汇层、字符层、语义层、基于大语言模型的评估器以及混合评估器等多种类型。评估维度包括假设层面的行为表现、整体稳定性、对输入扰动的敏感度、重复运行的变异程度、配置参数的敏感性以及结果的可复现性。

实验结果显示,各评估范式之间存在显著的行为权衡:没有任何评估器能够同时满足所有提出的正确性假设;即便在聚合得分上表现相近的评估器,其行为画像也可能相差甚远,表现出不同的假设符合度和稳定性特征。

这些发现表明,行为正确性假设能够提供传统聚合元评估所忽视的诊断信息,帮助研究者更细致地理解和选择适合特定任务的评估工具。

点评:行为假设框架为评估器的细粒度分析提供了新视角,建议在未来的评估标准中加入此类行为测试。

原文链接: https://arxiv.org/abs/2609.05289

[h] 返回首页