NeFut Logo NeFut
EN 管理员登录

[AI学术] 面向可靠且实用的评估流水线

发布于:2026-09-03 22:00 最后更新:2026-09-04 02:14
#AI #Machine Learning #LLM

LLM 驱动的软件系统在开发周期中越来越依赖评估作为质量关卡。现有研究多聚焦于评估可靠性的单一维度,未能覆盖实际需求。本文提出一个端到端的评估流水线,包含评估清单的生成以及对清单响应的学习型聚合。该聚合通过训练模型将多个 LLM 判官的答案统一,提高了判官间的一致性,并在对标人工标注时提升了准确率。流水线还提供自洽性检查、解释生成以及预测不确定性估计。实验表明,整体方案在一致性、解释性和不确定性度量上均优于基线。

点评

原文链接: https://arxiv.org/abs/2609.00805

[h] 返回首页