论文

代理不分页:LLM 工具响应的第一块选择

Agents Don't Paginate: First-Chunk Selection for LLM Tool Responses

上下文与知识上下文工程

摘要

基于 大语言模型 (LLM) 构建的 编码智能体,例如 Claude Code、Cursor、OpenAI Codex、GitHub Copilot 和 Aider,接收的工具响应通常超过代理的每轮 词元预算。标准补救措施,即分页,在生成这些响应的每个协议中都可用;然而,在来自公共模型上下文协议中间件的会话日志语料库中,我们没有观察到代理发起的对第二个块的请求。第一个块是智能体读取的内容,因此我们询问目标条目(智能体需要的物品)被放置在第一位的频率:1 精度率 $p_1$。在受控离线基准测试中,我们将第一个块选择视为 0/1 背包,并比较 500 个 SWE 基准验证任务上的六个值函数,然后使用五种语言模型上的单轮文件本地化探针测试 $p_1$ 是否重要(4,800 个 LLM 调用;不是端到端解析率测试)。两个预先登记的假设不成立,但却是我们的主要发现。核心的一个是负面的:提高 $p_1$ 并不能系统地提高下游准确性。每个模型的增量保持在三个百分点 (p.p.) 以下,符号不一致,并且没有模型显着;代理从块中的任何位置恢复金币,因此达到其答案的是第一个块的包含,而不是金币在其中的排名。第二:向关键字评分器添加四个文件元数据信号会使 $p_1$ 损失 4.8 个百分点。 (配对显着性检验,$p = 0.001$)。无参数关键字评分器确实将 $p_1$ 从 24.2% 基线提高到 35.0%(+10.8 p.p.,远远超出了偶然性;$p = 3.9 \times 10^{-8}$),并在没有关键字匹配时回退到工具的本机排序,提高到 35.8%。但根据我们的中心发现,这是 1 级增益,而 1 级是未达到代理答案的部分:下游精度不变。