NeFut Logo NeFut
EN 管理员登录

[AI学术] L-MARS:法律多智能体系统的代理搜索与引用可信度审计

发布于:2026-07-19 22:00 最后更新:2026-07-22 01:02
#algorithm #C++ #Open Source

随着大语言模型在法律问答中的应用日益增多,评估通常侧重于多选题的准确性。然而,这种评估方式忽视了一个常见的问题:答案附带的引用来源是否存在,并支持系统所归属的规则。我们提出了 L-MARS,一个开放的多智能体法律问答系统,具备代理搜索和法官驱动的证据检查,并对每个声明进行逐项审计。

每个原子声明被标记为六类分类,并在跨提供者判断下用严格的 ALCE 评分。通过对 100 道分层的律师考试进行审计,检索对准确性的提升微乎其微,但多轮法官循环将严格引用 F1 从 0.13(简单 RAG)提升至 0.25,并将无引用率从 34% 降至 13%。

我们进一步引入了 Faith-Search,这是一个重新验证和修复不可达引用的后期步骤;其将不可达率降至 1% 以下,但没有提高多轮循环的 F1,因此我们将其视为一种针对可达性的干预,而非可信度的突破。

通过 50 道 LegalSearchQA 案例研究,证实了这一现象:检索-再草拟流程的引用 F1 饱和在 0.75 附近,而单一智能体的网络搜索基线在外部审计下降至 0.22。

博主点评: L-MARS 的设计有效提升了法律问答系统的引用准确性,尤其是在多轮审计和代理搜索的结合下。尽管 Faith-Search 在可达性方面表现良好,但未能显著提升整体 F1,显示出引用的复杂性与挑战。系统的多智能体架构为法律领域的自动化问答提供了新的思路。

原文链接: https://arxiv.org/abs/2509.00761

[h] 返回首页