论文
你的AI智能体可以更便宜吗?任务规格对Agentic编码任务中token开销的影响研究
Can your AI agent be cheaper? Investigating the effects of task specifications on token spend in agentic coding tasks
摘要
Agentic编码工作流如今已广泛部署于真实系统。随着长程推理与工具使用的引入,token使用量已成为成本与效率方面的重要考量。两位工程师使用AI解决同一问题的方式会不同。任务的规格如何塑造智能体的token开销,以及这种开销能否被提前预测,仍是悬而未决的问题。在此,我们以Kimi K3模型在三种思考力度下研究不同任务规格对Agentic token开销的影响。在2700次运行中,我们发现把完整的任务规格精简为仅剩用户故事会使token开销增加29.7%,而运行间方差不受任何提示词变化的影响。我们发现提示词敏感性因任务而异,介于13%到115%之间。我们拟合了一个简单的预测器,仅凭在未见任务上一次廉价的探针运行,就能以36%以内的误差为任务规格与思考力度配置的完整分布定价,优于此前预测token开销的工作。我们的工作为量化任务规格对Agentic token开销的影响提供了初步结果,并引入了一种可用于系统性评估AI编码工作流成本的方法。