论文

LOCA-bench:在可控且极端的上下文增长下评测语言智能体

LOCA-bench: Benchmarking Language Agents Under Controllable and Extreme Context Growth

智能体系统上下文与知识上下文工程Agent HarnessAgent任务评测长程任务评测

摘要

大语言模型(LLM)执行长时程现实任务的能力日益增强。然而,随着上下文数量的增长,其可靠性常常退化,这一现象被称为“上下文腐化”(context rot)。现有的长上下文基准主要关注单步设置,评估模型从长片段中检索信息的能力。然而在现实场景中,LLM往往需要作为智能体行动:在动态增长的上下文下探索环境、遵循指令与计划、提取有用信息并预测正确的动作。为评估此类设置下的语言智能体,我们提出LOCA-bench(长上下文智能体基准)。给定任务提示,LOCA-bench利用对环境状态的自动化、可扩展控制来调节智能体的上下文长度。这一设计使LOCA-bench能够在保持底层任务语义不变的同时,以受控方式将上下文长度潜在地扩展至无限。LOCA-bench将语言智能体作为模型与脚手架的组合进行评估,其中包括多种上下文管理策略。虽然智能体性能总体上随环境状态变得更加复杂而下降,但先进的上下文管理技术能够显著提高整体成功率。我们开源LOCA-bench,为在长上下文Agentic场景中评估模型与脚手架提供平台:https://github.com/hkust-nlp/LOCA-bench

LOCA-bench:在可控且极端的上下文增长下评测语言智能体
图2:任务生成流水线示意图。图中展示了构建一个涉及从 Canvas 与电子邮件中读取期末考试信息的任务的示例。从左到右,它展示了基准用户如何设置环境配置参数,例如课程数量以及 Canvas 通知与电子邮件通知的比例。随后,程序化生成器使用针对课程、考试、通知和电子邮件的预定义模板来实例化匹配的环境状态——例如具体的 Canvas 课程页面、通知和电子邮件内容——并将其插入服务器。