论文

编码智能体 中即时引起的浪费:推理、努力、Harness设计和端到端成本

Prompt-Induced Waste in Coding Agents: Reasoning, Effort, Harness Design, and End-to-End Cost

智能体系统Agent任务评测

摘要

编码代理效率不能仅通过词元数量或模型价格来表征。端到端成本和任务成功共同取决于提示语义、推理工作、利用策略、模型、任务难度、工具使用、上下文管理和提供商会计。对照实验表明,提示措辞可以在不改变任务的情况下改变推理和验证行为,额外的推理工作可以帮助完成困难的任务,但也会增加成本而不带来收益,并且当工具发生变化时,效率干预的价值可能会改变。这些结果表明,及时、努力和利用是相互作用的实验因素,而不是独立的控制因素。我们将效率建模为由代理轨迹引起的每个成功任务的成本。词元和缓存计数是对该轨迹的测量,而不是足够的优化目标。因此,代理评估应该衡量成功和端到端成本,同时控制决定如何生成轨迹的系统变量。