论文

MGAL:多语言粒度感知长上下文基准

MGAL: A Multilingual Granularity-Aware Long-Context Benchmark

模型评测上下文与知识上下文工程基准与评测资源

摘要

长上下文大语言模型(LLM)的评估进展迅速。然而,现有基准大多局限于文档层级,且主要面向高资源语言,使许多细粒度挑战未得到充分评估。为填补这一空白,我们提出MGAL,首个多语言、粒度与位置感知的长上下文基准。MGAL基于联合国报告构建,跨度为8K至128K token,覆盖六种联合国官方语言。它涵盖四个连贯的语言粒度层级(词、句、段、文档),并进一步按条目在文档中的位置(开头、中间、结尾)分层,同时在文档与段落两个层级建立索引。这一设计支持对不同粒度的多语言长上下文理解进行系统诊断。通过大量实验与分析,我们发现:(1)LLM在词级任务上表现良好,但在更粗粒度任务上表现吃力;(2)闭源模型在较低资源语言上保持明显的性能优势。我们进一步识别出两个新挑战:(1)在局部语义拥挤——即相邻句子共享话题与实体——的情况下,模型倾向于追随表面线索(如“however”之类的连接词或重复实体),而非句子在上下文中的语篇角色(如背景、结果);(2)生成输出的流畅性与一致性之间存在差距:模型产出的文本读起来通顺,却偏离源文本事实。此外,我们还观察到若干与既往研究一致的模式,包括依赖邻近证据以及在不确定时重复使用选项。

MGAL:多语言粒度感知长上下文基准:论文配图
图1:MGAL 概览。从(a)对齐的多语言UN长上下文文档出发,我们构建了(b)覆盖问答、完形填空、段落填充、摘要和翻译的多任务基准。这些任务按(c)语言学粒度组织,并通过(d)围绕粒度、位置和语言的诊断分析进行评估。