论文
LLM 能否以具有法律意义的方式进行推理?欧洲人权法院案件的小规模研究
Can LLMs Reason in a Legally Meaningful Manner? A Small-scale Study on European Court of Human Rights Cases
摘要
推理已成为当代LLM的标准技术和特征;然而,其在法律案件预测等要求较高的法律导向任务中的应用和质量仍有待探索。我们使用欧洲人权法院 (ECtHR) 的法律案例作为测试平台,研究 LLM 在法律案件预测的背景下如何进行推理。我们通过探索替代的提示策略来评估 OpenAI GPT 5.4(最近的顶级 LLM),这些策略或多或少地暗示了在 ECtHR 法理学背景下什么才算是具有法律意义的推理。我们展示了通过人类和 LLM 评估来评估模型响应的结果。我们发现,所检查的模型在法律推理方面的得分远非理想,该模型产生结构完整但实质上浅薄的分析,并且 LLM-as-a-Judge 评估器具有内部一致性,但与我们训练有素的注释器的一致性很弱,即可靠,但不能有效替代人类评估。总体而言,专家策划的提示会带来更全面的推理,但与其他检查的设置相比,这不会导致更准确的预测。根据我们的发现,我们敦促社区不要仅仅依赖基于 LLM 的自动化评估,并避免使用任务准确性作为推理质量的适当代理。