NeFut Logo NeFut
EN 管理员登录

[AI学术] 全新基准:WuYu-EnvLE-Bench 助力评估环境法律执行中的大型语言模型

发布于:2026-07-22 22:00 最后更新:2026-07-23 12:33
#algorithm #AI #Machine Learning

在环境执法领域,大型语言模型(LLMs)正受到越来越多的关注,但它们在产生可追溯的执法决策方面的能力仍不明确。为此,我们推出了WuYu-EnvLE-Bench,这是一个基于真实执法案例、监管标准和专家评审构建的基准。该基准包含2521个实例、14个任务和12个污染媒介子领域,涵盖了前执法、执法和后执法的工作流程。

我们使用绝对环境执法分数(AES)和智能执法指数(IEI)来评估开源和闭源的LLMs,重点关注能力、响应质量和资源效率。结果显示,LLMs在规则限制任务上表现良好,但在证据链构建、矛盾检测、多源整合和程序判断方面仍然不可靠。

此外,模型扩展显示出收益递减的现象:中型模型在结构化任务中接近领先模型,而大型模型在克服证据推理瓶颈方面并不可靠。

WuYu-EnvLE-Bench强调了需要基于证据、规则意识和任务适应的执法推理。

原文链接: https://arxiv.org/abs/2607.17745

[h] 返回首页