论文
图鲁法律理解中的跨语言迁移:依赖于脚本的改进和 RAG 引发的知识冲突
Cross Lingual Transfer in Tulu Legal Comprehension: Script-Dependent Improvement and RAG-Induced Knowledge Conflict
摘要
没有足够的训练语料库的低资源语言通常使用相关的、资源较高的语言作为理解的支架。尽管如此,仍然需要开发严格的评估方法来识别模型何时在跨语言资源匮乏的环境中失败。以法律领域为背景,测试了三个模型(Llama3、Hex-1、Sarvam)对以低资源德拉威语言(Tulu)编写的法律投诉进行分类的能力。跨德拉威文字的音译查询允许模型在不使用大规模训练的情况下获得对说话者抱怨的初步理解,尽管理解水平在很大程度上依赖于脚本(卡纳达语 - 另一种资源相对较少的语言 - 产生最强烈的积极趋势)。通过 RAG 框架从卡纳达语法律文件语料库中检索得到的结果好坏参半。一些模型在某些条件下在理解方面具有微弱的积极趋势,但当模型失败时,它通常跨越两个轴:事实替换(专注于扭曲推理的特定段落摘录)和虚构(在查询或语料库中没有基础的幻觉)。在低资源领域内,结果将模型的信息解析和后续推理确定为推理失败的根源,而不是语料库内容。依赖于脚本的理解和 RAG 的稳健性似乎也是相辅相成的。推理跟踪分析和部署的统计诚实框架进一步支持了这一点,这些技术更广泛地适用于低资源多语言 RAG 评估。