论文
LexLattice:通过神经元胞自动机对文档层次结构进行多语言提取摘要
LexLattice: Multilingual Extractive Summarization via Neural Cellular Automata on Document Hierarchies
摘要
忠实性是法律文本摘要的一个核心问题,它激发了提取方法,选择可追溯到其来源的逐字内容。此类方法通常对段落或其他结构单元进行孤立排名,但很少关注分布在文档的较远部分之间并在其之间共享显着性的证据的整合。我们引入了 LexLattice,一种提取式摘要器,它将法律行为的层次结构具体化为二维语义格,并在选择之前用屏蔽的二维神经细胞自动机对其进行巩固。尽管将所有可训练容量集中在冻结多语言编码器上的 1.8M 参数合并器中,但 LexLattice 在多语言和跨语言设置中在 EUR-Lex-Sum 的所有 24 种语言中均实现了最先进的 ROUGE,超越了具有数十亿参数的指令调整基线。仅接受过高资源语言训练的整合器进一步以近乎无损的保留率转移到未见过的语言(0.99),表明该模型在与语言无关的语义几何而不是表面形式上运行。我们的结果将文档结构的明确整合定位为多语言法律摘要规模的紧凑且可追踪的替代方案。