论文

ObjectGraph:从文档注入到知识遍历——面向智能体时代的原生文件格式

ObjectGraph: From Document Injection to Knowledge Traversal -- A Native File Format for the Agentic Era

上下文与知识知识图谱

摘要

现有的每一种文档格式都是为沿文本线性阅读的人类读者设计的。自主LLM智能体不是在阅读,而是在检索。这一根本性错配迫使智能体把整个文档注入其上下文窗口,把token浪费在无关内容上,在多轮循环中不断累积状态,并把信息不加区分地广播给各个智能体角色。我们认为这既不是提示工程问题,也不是检索问题,更不是压缩问题:而是一个格式问题。我们提出OBJECTGRAPH(.og),这种文件格式将文档重新构想为可遍历的类型化有向知识图,而非等待注入的字符串。OBJECTGRAPH是Markdown的严格超集——每个.md文件都是合法的.og文件——除一个仅含两种原语的查询协议外无需任何基础设施,且无需工具即可被人类和智能体共同读取。我们形式化了文档消费问题(Document Consumption Problem),刻画了现有格式无法同时满足的六项结构性质,并证明OBJECTGRAPH同时满足全部六项。我们进一步引入渐进式披露模型(Progressive Disclosure Model)、角色范围访问协议(Role-Scoped Access Protocol)和可执行断言节点(Executable Assertion Nodes)作为格式原生原语。在五类文档和八类智能体任务上的实证评估表明,token最多减少95.3%,且任务准确率无统计学显著下降(p > 0.05)。转译器(transpiler)在留出文档基准上的内容保真度达到98.7%。