论文
ONTO:用于 LLM 输入优化的词元有效的柱状表示法
ONTO: A Token-Efficient Columnar Notation for LLM Input Optimization
摘要
专为文档交换而设计的序列化格式会带来结构开销,当 大语言模型 大规模消耗操作数据时,这种开销会变得令人望而却步。序列化为 JSON 的 1,000 个物联网传感器读数的适度数据集需要大约 80,000 个标记 - 大部分花费在重复的字段名称、嵌套大括号和结构标点符号上,而不是语义内容上。我们提出了 ONTO(用于词元优化的对象表示法),这是一种柱状表示法,它为每个实体声明一次字段名称,并使用基于缩进的层次结构将值排列在管道分隔的行中。这种一次模式、多数据设计消除了每条记录的键重复,同时保留了人类可读性和嵌套结构支持。对三个综合操作数据集的评估表明,与 JSON 相比,词元减少了 46-51%,记录数量从 100 条稳定扩展到 1,000 条。 Qwen2.5-7B 上的受控推理基准测试显示相应的延迟改善了 5-10%。理解验证确认,当提供格式上下文时,LLM 任务在查找、计数、提取和聚合操作中的准确性没有实质性下降。消融分析表明,键重复占 JSON 开销的大部分,嵌套结构中的缩进成本解释了平面数据和分层数据之间 4 个百分点的差距。 ONTO 在序列化领域占据了以前未填补的位置:具有分层结构的柱状效率,针对 LLM 上下文窗口而不是文档交换进行了优化。代码和规范可在 https://github.com/harsh-aranga/onto 获取。