NeFut Logo NeFut
EN 管理员登录

[AI学术] 无参考评估框架:开放式问答中的推理能力审计

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#algorithm #AI #Open Source

在高风险领域中,AI生成的答案往往流畅但难以验证,尤其是在涉及多步骤推理而非单一最终答案时。

我们提出了一种基于推理的无参考框架,用于审计LLM生成的输出。该方法将生成的推理轨迹分解为多个片段,使用自然语言推理(NLI)标记局部前提-目标关系,并将这些关系组织成一个超图。

接着,通过确定性反向AND-OR搜索为每个片段分配审计标签,这些标签指示每个片段在生成响应中的基础。我们在两个场景中评估了该框架:使用Hard2Verify进行演绎数学推理,以及使用UroReason进行开放式医学推理,这是一个新的由医生注释的LLM推理轨迹基准,基于真实临床案例。

在这些场景中,我们的NLI-超图审计提供了比直接以LLM作为评判基准更可靠的无参考评估信号。在临床环境中,最先进的LLM评判者往往未能识别出有问题的推理片段,过于接受流畅但基础薄弱的响应。

我们的研究表明,问答评估应考虑推理轨迹中推理关系的组合,而不仅仅依赖最终答案或将LLM作为验证者。UroReason将通过API提供,且我们的代码将作为开源发布。

博主点评: 本文提出的无参考推理审计框架为开放式问答领域提供了一种新思路,尤其是在AI生成内容的可信度评估上。通过对推理过程的细致分析,能够更好地识别潜在的推理缺陷,为高风险应用中的AI系统提供更可靠的支持。开源代码和API的发布无疑将促进后续研究的发展。

原文链接: https://arxiv.org/abs/2607.19678

[h] 返回首页