在环境执法领域,大型语言模型(LLMs)正受到越来越多的关注,但它们在产生可追溯的执法决策方面的能力仍不明确。为此,我们推出了WuYu-EnvLE-Bench,这是一个基于真实执法案例、监管标准和专家评审构建的基准。该基准包含2521个实例、14个任务和12个污染媒介子领域,涵盖了前执法、执法和后执法的工作流程。
我们使用绝对环境执法分数(AES)和智能执法指数(IEI)来评估开源和闭源的LLMs,重点关注能力、响应质量和资源效率。结果显示,LLMs在规则限制任务上表现良好,但在证据链构建、矛盾检测、多源整合和程序判断方面仍然不可靠。
此外,模型扩展显示出收益递减的现象:中型模型在结构化任务中接近领先模型,而大型模型在克服证据推理瓶颈方面并不可靠。
WuYu-EnvLE-Bench强调了需要基于证据、规则意识和任务适应的执法推理。