论文
JTON:面向大语言模型的token高效JSON超集与Zen Grid表格编码
JTON: A Token-Efficient JSON Superset with Zen Grid Tabular Encoding for Large Language Models
摘要
当LLM处理结构化数据时,序列化格式直接影响成本与上下文利用率。标准JSON会在表格数组的每一行中重复键名而浪费词元,这种开销随行数线性增长。本文提出JTON(JSON Tabular Object Notation),一种严格的JSON超集,其核心思想Zen Grid将列标题提取为单独一行,并用分号编码各行的值,在保留JSON类型系统的同时削减冗余。在七个真实领域的数据上,与JSON compact相比,Zen Grid将词元数量减少15-60%(平均28.5%;使用bare_strings时为32%)。在10个LLM上的理解测试显示,相对JSON净准确率提升0.3个百分点:四个模型提升、三个持平、三个略有下降。在12个LLM上的生成测试在少样本与零样本设置下均达到100%的语法有效性。Rust/PyO3参考实现还提供SIMD加速的解析,速度达到Python json模块的1.4倍。代码、包含683个向量的测试套件以及全部实验数据均已公开。