论文
压缩下的控制:工具Agent的可靠性边界
Control Under Compression: Reliability Frontiers for Tool-Using Agents
摘要
工具使用语言模型代理不仅受任务提示的影响,还受持续的系统侧指令影响,这些指令具体说明工具、参数、策略、执行协议和恢复方法。压缩这些代理控制上下文(ACC)可以减少输入成本和上下文使用,但现有的提示压缩评估并未揭示结果控制是否仍然操作可靠。我们引入 CompressAgent,这是一个跨九个独立构建的 ACCs、三个任务家族、三个固定 Qwen API 模型标识、六个保留上下文预算和 15,525 次运行的环境验证基准。我们揭示了一个非线性的、方法依赖的可靠性前沿。在 75% 的保留上下文,通用重写和基于节的压缩达到 92.7% 和 92.4% 的成功率,接近 93.8% 的全上下文基准。在 50% 到 35% 之间,方法显著分歧;在 35% 时,基于节的、义务意识的和通用重写达到 47.0%、39.0% 和 19.9%。在保留上下文预算从 25% 到 10% 之间,可执行协议变得脆弱。可靠性也随 ACC 的不同而显著变化,使通用压缩排名不适用,因此需要基于上下文的资格。失败分析表明,压缩主要表现为工具执行和动作解析错误。这些发现将 ACC 压缩从 token 减少转变为一个需要通过可执行结果评估的运行可靠性问题。