NeFut Logo NeFut
EN 管理员登录

[AI学术] 面向查询无关的RAG评估:通过查询覆盖和断言可验证性

发布于:2026-08-13 22:00 最后更新:2026-08-14 00:05
#Machine Learning #LLM #Open Source #DeepSeek #GPT

最近的一项研究提出了一种新的评估框架,称为Q-CARE,用于评估增强生成模型的检索能力。这种框架可以对查询和回答进行细粒度的分析,通过将查询分解为子查询和答案分解为原子断言,实现对检索和生成能力的统一评估。Q-CARE框架包括两个主要指标:查询覆盖率(C-Prec@k,C-nDCG@k)和断言级别生成指标(完整性、简洁性和可验证性)。实验结果表明,Q-CARE框架在八个数据集上的性能优于现有的四种RAG评估指标。 代码和数据已经公开在https://github.com/DISL-Lab/Q-CaRE-COLM-26。 博主点评: Q-CARE框架为增强生成模型的评估提供了一个新的思路,通过对查询和回答进行细粒度分析,可以更好地评估模型的检索和生成能力。这种框架的提出对提高大语言模型的可靠性和实用性具有重要意义。

原文链接: https://arxiv.org/abs/2608.11238

[h] 返回首页