论文
ViLegalNLI:越南法律文本的自然语言推理
ViLegalNLI: Natural Language Inference for Vietnamese Legal Texts
摘要
在本文中,我们介绍了 ViLegalNLI,这是第一个专门为法律领域构建的大规模越南自然语言推理(NLI)数据集。该数据集由 42,012 个源自官方法定文件的前提-假设对组成,并用二元推理标签(蕴含和非蕴含)进行注释。它涵盖多个法律领域,反映了以结构化逻辑、条件条款和特定领域术语为特征的现实法律推理场景。为了构建 ViLegalNLI,我们提出了一个半自动数据生成框架,该框架集成了 大语言模型 用于受控假设生成和系统质量验证程序。该框架结合了伪影缓解策略和跨模型验证,以提高注释可靠性并确保法律一致性。生成的数据集捕获了多种推理模式,包括释义、逻辑含义和法律上无效的推论,从而为越南法律推理任务提供了全面的基准。我们使用多语言模型、越南语特定的预训练语言模型和指令调整的 大语言模型 对 ViLegalNLI 进行了广泛的实验。结果表明,少样本 LLM 配置始终能够实现卓越的性能,而性能受到假设长度、词汇重叠和推理复杂性的显着影响。跨领域评估进一步揭示了跨不同法律领域推广法律推理的挑战。总体而言,ViLegalNLI 为越南法律 NLI 建立了基础基准,并支持法律推理、法定文本理解以及开发用于法律分析和决策支持的可靠人工智能系统的未来研究。该数据集可公开用于研究目的。