论文

从对标到推理:越南法律文本LLM的双方面大规模评估

From Benchmarking to Reasoning: A Dual-Aspect, Large-Scale Evaluation of LLMs on Vietnamese Legal Text

模型评测模型能力评测

摘要

越南法律文本的复杂性对公众诉诸司法构成了重大障碍。虽然 大语言模型 为法律文本简化提供了一个有前景的解决方案,但评估其真正功能需要超越表面指标的多方面方法。本文介绍了一个全面的双方面评估框架来满足这一需求。首先,我们为四个最先进的 大语言模型(GPT-4o、Claude 3 Opus、Gemini 1.5 Pro 和 Grok-1)建立了三个关键维度的性能基准:准确性、可读性和一致性。其次,为了了解这些性能分数背后的“原因”,我们使用一种新颖的、经过专家验证的错误类型,对 60 篇复杂的越南法律文章的精选数据集进行了大规模错误分析。我们的结果揭示了一个关键的权衡:像 Grok-1 这样的模型在可读性和一致性方面表现出色,但在细粒度的法律准确性方面有所妥协,而像 Claude 3 Opus 这样的模型则获得了很高的准确性分数,掩盖了大量微妙但关键的推理错误。错误分析指出 \textit{不正确的示例} 和 \textit{误解} 是最常见的失败,确认当前 LLM 的主要挑战不是总结,而是受控的、准确的法律推理。通过将定量基准与定性深入研究相结合,我们的工作为 LLM 的法律应用提供了全面且可操作的评估。