论文

LLM 为 TOON 做好准备了吗?基准测试新型结构化输出格式的结构正确性-可持续性权衡

Are LLMs Ready for TOON? Benchmarking Structural Correctness-Sustainability Trade-offs in Novel Structured Output Formats

模型评测评测方法与指标

摘要

大语言模型(LLM)日益被要求为下游系统生成结构化、机器可读的输出。虽然近期基准聚焦于评估此类输出的结构正确性,但不同输出格式的推理环境影响却在很大程度上被忽视。本文主张,结构化输出格式不仅应按正确性评估,还应按其环境效率评估。为此,我们引入一个面向结构化生成的可持续性感知评估框架,测量 token 使用量、生成时间与估算碳排放。在该框架内,我们提出环境感知生成正确性分数(GCS_env),一个将结构正确性与碳感知效率整合的统一指标。利用该框架,我们在跨不同架构与参数规模的多个 LLM 上,系统地将新格式 TOON 与既有表示(JSON、XML、YAML)进行基准比较。结果揭示了一个一致的趋势:TOON 产出明显更紧凑的输出与更低排放,但在模型缺乏原生支持时结构正确性较低。我们表明,更大的模型容量可以缩小这一差距,且环境感知打分会随部署优先级改变格式排名。这凸显了将可持续性纳入基准测试的必要性,并提供了经验证据,表明 TOON 等紧凑表示可在大规模、碳敏感的 LLM 部署中带来实际优势。