论文

保真度还不够:用于代理数据表提取的调度级仪表

Fidelity Is Not Enough: Dispatch-Level Instrumentation for Agentic Datasheet Extraction

智能体系统Agent任务评测

摘要

一款模型无需打开数据表就通过了我们的保真度检查。我们在对内部提取服务的模型进行资格认证时发现了这一点:结构化输出约束已经悄悄地禁用了工具的使用,并且模型无论如何都用捏造的源文本进行了回答。只有每个工具的跟踪暴露了它。保真度——提取的值是否与源匹配——是代理文档提取的标准衡量标准,它对运行成功进行评分。因此,我们将每个工具调用记录在代理基准中,该基准包含三个组件中的 25 个手工策划的声明,第四个组件上还有 12 个声明,总共 37 个。根据该调度记录,我们构建了两个工具:一个基于规则的故障归因分类器和一个静默故障检测器,其两个规则仅检查调用了哪些工具,而不检查提取的值。该检测器对三个模型系列中的 207 个干净的保真度通过提取没有提出任何标记,并恢复了所有 50 个植入的错误,这些错误准确地保留了其规则检查的工具。这两个结果不是对称的:第一个限制了误报率,第二个是通过构造召回,并且针对调用其工具但仍然错误回答的运行的检测能力是无法测量的。第二个独立的预言机,即测试数据表的声明在物理测量下是否成立的因果室,是故意部分的:它只确认设备可以执行的操作,即这 37 项声明中的 2 项的可验证信封,并且我们给出了为什么其余部分不可物理分级的分类。在受控扰动下,保真度贯穿始终,而腔室的判决则根据测量不确定性精确翻转。在三个已部署的模型堆栈(其中一个因其服务堆栈而不是任何能力差距而不稳定)中,工具层购买的是可移植性和可观察性而不是准确性,并且只有在文档超出上下文窗口时才获得其溢价。