论文
LOCA-bench:在可控且极端的上下文增长下评测语言智能体
LOCA-bench: Benchmarking Language Agents Under Controllable and Extreme Context Growth
摘要
大语言模型(LLM)执行长时程现实任务的能力日益增强。然而,随着上下文数量的增长,其可靠性常常退化,这一现象被称为“上下文腐化”(context rot)。现有的长上下文基准主要关注单步设置,评估模型从长片段中检索信息的能力。然而在现实场景中,LLM往往需要作为智能体行动:在动态增长的上下文下探索环境、遵循指令与计划、提取有用信息并预测正确的动作。为评估此类设置下的语言智能体,我们提出LOCA-bench(长上下文智能体基准)。给定任务提示,LOCA-bench利用对环境状态的自动化、可扩展控制来调节智能体的上下文长度。这一设计使LOCA-bench能够在保持底层任务语义不变的同时,以受控方式将上下文长度潜在地扩展至无限。LOCA-bench将语言智能体作为模型与脚手架的组合进行评估,其中包括多种上下文管理策略。虽然智能体性能总体上随环境状态变得更加复杂而下降,但先进的上下文管理技术能够显著提高整体成功率。我们开源LOCA-bench,为在长上下文Agentic场景中评估模型与脚手架提供平台:https://github.com/hkust-nlp/LOCA-bench
