论文

法律本体学习中,如何衡量原文含义是否得到保留

On Measuring Semantic Preservation in Legal Ontology Learning

模型评测上下文与知识本体评测方法与指标

摘要

本体学习将非结构化文本转换为结构化表示以进行自动推理。然而,结构化信息有丢失信息的风险,而当前的评估方法无法检测到这种丢失,只关注结构的正确性,而无法衡量意义是否能够在转变中幸存下来。我们提出了一种解决此问题的评估方法:将源文档上的 LLM 任务性能与转换表示上的性能进行比较,并量化语义损失的差异。我们在法律合并协议分析中展示了这种方法,该领域因其复杂的语言和精确的语义要求而被选择,将直接的 LLM 应用程序与跨六种语言模型的三种本体学习方法进行比较。结果揭示了系统语义损失,其基于推理复杂性和模型方法交互而存在显着变化。我们的贡献是:(1)用于衡量本体学习中语义保留的评估框架,以及(2)经验证据表明语义损失随着模型-方法配对的变化而显着变化,为在法律知识系统中选择最佳配置提供指导。