论文

WildTrace:长上下文推理中自然证据轨迹的基准测试

WildTrace: Benchmarking Natural Evidence Trails in Long-Context Reasoning

模型评测基准与评测资源

摘要

回答长文档中的复杂问题经常需要整合证据,证明来源本身自然地分散在遥远的段落中。在事故报告中,共同解释灾难的运行状况、设计缺陷和安全检查缺失可能会出现在数十个部分;在小说中,人物的真实动机只能通过远离相关时刻的场景才能显现出来。这种源内部证据整合对于现实世界的长文档分析至关重要,但现有的基准在很大程度上回避了它。针式探测、植入的事实和逆向工程的多跳链嵌入的证据可能在分布、放置或注册方面与宿主文本不同,因此不清楚强大的性能是否反映了真正的源推理或分布工件。我们引入了 WILDTRACE,这是一个包含 214 个自然发生的长格式来源(例如技术事件报告和鲜为人知的文学叙事)的 481 项任务的基准,其中所有证据线索都来自文档自身的因果、时间和叙事逻辑。利用 Pearl 的因果层次结构和先前的多跳推理类型,我们定义了七种源内部证据几何,这些几何描述了长文档中分析阅读的独特关系需求。在编写问题之前,源优先的构建管道会从文档结构中挖掘候选线索;然后,每个项目都经过多阶段验证,包括线索必要性、答案基础性、标题保真度、抗污染性和可回答性。随着模型越来越多地承担现实世界的高风险分析任务,获取信息和对自然分散的证据进行推理之间的差距成为下一阶段长上下文研究的决定性挑战。