论文

符号表示很重要:Agentic AI 系统中token优化格式的基准研究

Notation Matters: A Benchmark Study of Token-Optimized Formats in Agentic AI Systems

智能体系统智能体互操作协议Agent任务评测MCP

摘要

Agentic AI 系统中的大语言模型使用工具模式和执行结果,并将工具调用作为结构化数据发出。该交换的默认语言 JSON 是为应用程序到应用程序的交换而不是token效率而设计的,因此其结构元素会带来大量的token开销。最近的工作提出了token优化的替代方案,例如 TOON(面向token的对象表示法)和 TRON(token简化对象表示法)作为更紧凑的替代品,但这些格式仅在孤立的理解或生成任务上进行了评估。因此,他们的token减少是否保持在端到端代理循环内仍然是一个悬而未决的问题。我们在四个代理基准(BFCL、MCPToolBenchPP、MCP-Universe、StableToolBench)和五个开放权重 LLM 上评估 TOON 和 TRON,将输入压缩与输出压缩解耦,以独立测量理解和生成。 TRON 减少了高达 27% 的token,准确度在 JSON 基线的 14pp 以内。 TOON 以类似的 9pp 准确度成本实现了高达 18% 的降低,但另外还导致了多轮解析失败的级联,并崩溃了大多数模型的并行工具调用输出。

符号表示很重要:Agentic AI 系统中令牌优化格式的基准研究
图 1:工具增强管道中的格式替换。 (a) 以 JSON、TOON 和 TRON 编码的相同工具模式。 (b) 工具调用循环,用绿色注释标记三个格式转换点以及在每个转换点观察到的聚合token节省。工具模式和工具结果大幅压缩(在 TOON 下分别高达 − 23 % -23\% 和 − 32 % -32\%),而工具调用由于多轮基准测试中的解析失败而显示没有净节省(参见第 5 节和第 6 节)。 (c) 每个模型token准确度视图,四个基准的平均值(每个基准百分比的平均值)。每个标记都是一种(模型、格式)组合,x 轴显示每个基准标记与 JSON 的平均变化,y 轴显示跨基准的平均准确度。线条跟踪每个模型的 JSON → \to TOON 和 JSON → \to TRON 运动。 TRON 在 Qwen3-32B no-think 上实现了高达 − 27 % -27\% 的token减少,比 TOON 的 − 18 % -18\% 还要高。准确度下降也有很大差异:TOON 的准确度下降在 1 1 到 9 9 pp 之间,TRON 的准确度下降从 + 3 +3 pp 下降到 − 14 -14 pp。这两种格式都没有统一地占据主导地位,而且格式与模型之间的相互作用在大小上与格式选择本身相当。