NeFut Logo NeFut
EN 管理员登录

[AI学术] LexAgentHallu:用于评估法律智能体幻觉的层次化基准

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#Machine Learning #LLM #Artificial Intelligence

随着大语言模型被广泛用于工具增强的法律智能体,它们会产生智能体幻觉——工具调用和推理错误会层层叠加,导致捏造的判例或错误引用的权威文献。现有法律基准仅关注单轮问答的结果指标,缺乏对法律智能体在多步推理过程中的幻觉进行诊断的能力,也无法回答智能体在何种程度、何种方式上出现幻觉。

为弥补这一空白,我们提出 LexAgentHallu,一个专门用于评估法律智能体在多步骤轨迹中出现幻觉的基准。该基准通过四阶段专家循环构建,涵盖 17 个法律子领域和 6 种任务类型,共计 3414 条实例。每条实例均依据双层幻觉分类体系标注:7 大类、27 细分类,既包括实质性错误,也覆盖智能体的程序性失误。

我们进一步设计了细粒度度量,能够量化每一次失败的程度,并定位其在执行路径中的具体位置。基于这些度量,对 18 种商业化和开源法律智能体进行评测,发现了 正确答案‑错误推理(Right-Answer-Wrong-Reason)现象,并且幻觉的细分类呈现聚类趋势,形成了与智能体框架、法律任务和法律类别相关的独特画像。这些信息在仅看结果指标时是不可见的,验证了 LexAgentHallu 在法律领域诊断智能体幻觉的有效性。

点评

原文链接: https://arxiv.org/abs/2609.09754

[h] 返回首页