论文

数据代理需要语义元数据吗?代理数据检索的比较研究

Do Data Agents Need Semantic Metadata? A Comparative Study in Agentic Data Retrieval

智能体系统Agent任务评测

摘要

在自主代理时代,机器可操作的数据对于数据驱动的工作流程至关重要。十多年来,像 schema$.$org 这样的语义元数据已经为机器可操作数据奠定了 FAIR 原则(可查找、可访问、可互操作和可重用),并启用了 Google 数据集搜索等发现工具。然而,能够导航非结构化网络的 大语言模型 (LLM) 的兴起提出了一个基本问题:语义元数据对于代理数据发现仍然是必要的,或者代理是否可以直接从网络可靠地检索可操作的数据?我们对两个不同环境中的代理数据检索进行了比较分析:基线代理搜索数十亿个开放网络文档,语义代理使用 schema$.$org 利用 9000 万个数据集的语料库。我们部署了一个“LLM-as-a-judge”评估管道,直接映射到公平原则,以评估检索数据的语义相关性、数据可访问性和计算效用。我们的结果显示出明显的差异。语义代理擅长检索可操作的数据,元数据丰富的注册表的精度提高了 44.9%,返回结果中包含机器可读下载的页面的精度提高了 46.6%。相反,基线代理经常遭受“最后一英里实用程序”故障,检索大量文字页面(占结果的 20.1%)和门户登录页面(8.5%),而不是实际数据页面。虽然基线代理通过回答 40% 以上的问题实现了更高的覆盖率,但语义代理提供了更高的准确性,在检索符合 FAIR 的数据集时实现了 65.7% 的整体精度提高。我们的结论是,虽然非结构化检索支持广泛的探索性任务,但结构化生态系统仍然是可靠、面向执行的自主工作流程不可或缺的基础。