论文
WuYu-EnvLE-Bench:评估大语言模型环境执法能力的基准
WuYu-EnvLE-Bench: A Benchmark for Evaluating Large Language Models in Environmental Law Enforcement
摘要
大语言模型(LLM)日益被考虑用于环境执法,但其产出可追溯执法决策的能力仍不清楚。我们提出WuYu-EnvLE-Bench,一个由真实执法案例、监管标准与专家评审构建的基准:含2,521个基准实例、14个任务、12个污染介质子域,覆盖执法前、执法中与执法后工作流。以绝对环境执法分数(AES)与智能执法指数(IEI),我们在能力、响应质量与资源效率上评估开源与闭源LLM。结果显示:LLM在规则有界的任务上表现良好,但在证据链构建、矛盾检测、多源整合与程序性判断上仍不可靠。模型扩展也呈现收益递减:中型模型在结构化任务上接近领先模型,而更大模型并不能可靠克服证据推理瓶颈。WuYu-EnvLE-Bench凸显了对证据落地、规则感知、任务自适应执法推理的需求。