论文

机器可解释的信息:将文档编译为可搜索和可读的协议状态

Machine-Interpretable Information: Compiling Documents into Searchable and Readable Protocol States

上下文与知识上下文工程

摘要

长上下文语言模型通过原始自然语言与外部知识交互。在检索增强系统中,这会产生持久的索引-有效负载分裂:密集向量支持可搜索路由,但模型必须重新摄取冗长的文本有效负载才能以 O(N^2) 注意力成本进行推理。现有的压缩方法进一步产生与特定架构相关的私有状态。我们引入机器可解释信息 (MII),这是第一个代理到代理 (A2A) 文档到状态协议。双时间尺度状态空间 Writer 将文档编译为规范的固定带宽状态(56 个标记),轻量级 Translator 将其映射到任何冻结 Reader 的嵌入空间,从而将查询时间成本降低到 O(K)。生成的 .mii 工件将检索(可搜索几何)、推理(全局内存)和重建(基础细节)统一在单个可传输介质中。我们展示了跨异构 LLM(例如 Llama、Qwen、Mistral)的强大跨模型互操作性——尽管 Writer 使用遗留的 GPT-2 词汇,强制进行真正的语义翻译而不是标记级记忆。机械探针揭示了模块化的潜在结构:实体表示可以在不相关的文档状态之间进行因果追踪和零样本移植,同时保持可解码。为了解决固定带宽下的词汇重建问题,我们提出了 Residual-MII,这是一种将编译的全局内存与稀疏本地证据相结合的缓存层次结构。在 HotpotQA(7,405 个查询)上,Residual-MII 在大约 7% 的注意力失败率上超过了全上下文精确匹配,这表明向编译的、可转移的神经文档格式的范式转变。