论文
通过自适应结构化非结构化数据实现词元高效的数据推理智能体
Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data
摘要
有价值的数据仍然嵌入在非结构化来源中:网页、报告、合同、文件、财报电话会议和 PDF。企业人工智能的一大赌注是部署 LLM 代理,对这些数据进行推理,为每个知识工作者回答复杂的问题。如今,代理商可以做到这一点,但成本却高得令人望而却步。每个问题都会反复打开大型文档来恢复分散的证据,消耗多达一百万个token。然而,如果数据已经结构化,那么同样的问题将简化为廉价的数据库查找。例如,在 FanOutQA 基准上,对理想的预结构化存储的推理成本要低 28 倍,并且随着问题在更多文档上展开,差距会扩大到几个数量级。然而,提前构建所有内容是不可行的:文档包含的可能结构比任何工作负载使用的都要多得多,并且在查询到达之前,有用的结构和文档是未知的。我们提出了代理数据破解,这是一种自适应和推测性地构造非结构化数据作为推理本身的副产品的方法。结构化是适应性的,因为观察到的查询决定它何时发生以及什么是重要的,并且是推测性的,因为它超出了当前的问题。每当代理打开文档进行回答时,破解子代理就会以边际成本从已加载的上下文中分叉,并提取可能用于服务未来相关查询的基础结构。随着时间的推移,越来越多的查询完全由结构化数据覆盖,无需打开文档即可得到答复,从而将代理准确性保持在接近 RAG 成本的水平。在 FanOutQA 上,每个测试问题仅扩展一个相关问题,破解成本可降低 53%,同时保持准确性。代理数据破解是对非结构化数据进行代理推理的下一代数据基础设施的第一步:模型下方的共享基础,推理已经付费发现的知识在其中积累。
