论文

混乱:在干扰因素和长度效应下衡量对文档的理解

MUDDLE: Measuring Understanding of Documents under Distractor and Length Effects

模型评测基准与评测资源

摘要

文档问答系统越来越多地回答有关检索到的文档集合而不是单一来源的问题,因此对分散注意力的上下文的鲁棒性与阅读能力一样重要。当此类系统失败时,通常不清楚上下文是否太长或干扰因素是否太接近主题,因为之前的工作往往会混淆这两种影响。我们提出了 MUDDLE,一个将它们分开的受控基准。 MUDDLE 使用 270 个人工注释的问题,每个问题都与一个源文档相关,并在五种情况下实例化每个问题:单独的源、具有两个或四个主题相似的硬否定的源以及具有两个或四个随机干扰项的源。随机干扰因素与长度和来源方面的硬阴性相匹配,因此两个臂之间的准确度差距反映了主题相似性而不是长度。所有五个条件均以 Markdown、页面图像和原始 PDF 形式呈现,但此处报告的干扰项扫描是在 Markdown 中运行的,因为源及其干扰项超出了当前图像和 PDF 输入限制。我们通过 LLM 法官对三个模型系列的答案进行评分。在完整的降价扫描中,在 gpt-5-mini 的两种上下文大小下,硬底片比长度匹配的随机文档降低了准确度,而随机文档则保持在无干扰基线附近。效果虽小,但方向一致,并且对于 gpt-5-mini 硬负片,当跨上下文大小进行汇总时,其表现明显低于长度匹配的随机干扰项。我们发布了用于上下文退化的可重复研究的数据和评估代码。