论文
人工智能代理如何花钱?分析和预测代理编码任务中的词元消耗
How Do AI Agents Spend Your Money? Analyzing and Predicting Token Consumption in Agentic Coding Tasks
摘要
人工智能代理在复杂的人类工作流程中的广泛采用正在推动 LLM 词元消费的快速增长。当将代理部署到需要大量词元的任务时,自然会出现三个问题:(1)人工智能代理将词元花在哪里? (2) 哪些模型的词元效率更高? (3) 代理可以在任务执行之前预测其词元使用情况吗?在本文中,我们首次系统地研究了代理编码任务中的词元消耗模式。我们在 SWE-bench Verified 上分析了来自八个前沿 LLM 的轨迹,并评估模型在任务执行之前预测其自身词元成本的能力。我们发现:(1)代理任务的成本特别高,消耗的词元比代码推理和代码聊天多 1000 倍,其中输入词元而不是输出词元驱动了总体成本; (2) 词元使用情况高度可变且本质上是随机的:同一任务上的运行词元总数可能相差 30 倍,并且较高的词元使用量并不意味着较高的准确性;相反,准确性通常在中等成本时达到峰值,并在较高成本时达到饱和; (3) 模型的词元效率差异很大:在相同的任务上,Kimi-K2 和 Claude-Sonnet-4.5 平均比 GPT-5 多消耗超过 150 万个词元; (4) 人类专家评估的任务难度与实际词元成本的一致性很弱,揭示了人类感知的复杂性与代理实际花费的计算量之间的根本差距; (5) 前沿模型无法准确预测自己的词元使用情况(相关性为弱到中等,最高 0.39),并且系统性地低估了实际词元成本。我们的研究为人工智能代理的经济学提供了新的见解,并可以启发该方向的未来研究。