NeFut Logo NeFut
EN 管理员登录

[AI学术] CriticGen:面向生成的细粒度评估与可操作反馈

发布于:2026-09-10 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #LLM

CriticGen 是一种细粒度、面向生成的评估框架,能够将评估转化为可操作的答案改进控制。首先在主观、客观、自主约束等高层类别下为每个样本生成特定的评估维度和评分标准,这些标准构成动态评分表(rubric)。随后模型在同一 rubric 条件下同时输出得分、原因、可执行的改进建议以及改进后的答案。该过程使模型能够诊断缺陷并进行针对性提升。实验表明,细粒度评估必须是实例特定且可操作的。CriticGen 产生的 rubric 在相关性/覆盖度上从 3.33/4.03 提升至 3.97/4.24。相关性得分与人工标注的 Pearson 为 0.9556,Spearman 为 0.9560。基于 rubric 的原因和可执行建议的 F1 分别从 0.6369/0.5994 提升至 0.7554/0.7900。最关键的是,反馈能够可靠地改进答案,改进率为 73.17%,非退化率为 93.28%。

点评

原文链接: https://arxiv.org/abs/2609.05439

[h] 返回首页