论文
LongHarness Bench:用于长上下文推理的压力测试语言模型工具
LongHarness Bench: Stress-Testing Language Model Harnesses for Long-Context Reasoning
摘要
语言模型 (LM) 工具使 LM 能够使用额外的计算在长上下文中有效运行。然而,现有的长上下文评估不足以区分现代Harness,这反映在Harness之间的饱和准确度和大致相似的评估成本上。在本文中,我们引入了一个用于评估长上下文Harness的有效性和效率的基准。我们的任务需要多样化的检索策略,包括词汇搜索和语义匹配,以及针对全局和本地上下文的策略和自适应推理。大部分上下文在语义上是相关的,但只有一小部分在每个步骤中有用,从而产生了具有挑战性的搜索问题和不同的准确性 - 跨处理策略的成本权衡。例如,一项任务需要使用分散在文档中的证据来识别满足多个条件的每个人;首先策略性地检查最具选择性的条件可以在验证其余条件之前缩小搜索范围。我们使用四种最先进的工具来评估多个前沿语言模型系列。即使对于强大的模型-Harness组合,我们的基准仍然具有挑战性:四个评估套件中最好的达到 68% 的宏观平均准确度。更重要的是,我们发现相同的底层模型在不同的Harness下可以表现出明显不同的效率。我们的结果将效率确立为长上下文评估的重要轴,并为开发战略性而非详尽地处理上下文的工具提供了一个测试平台。