超越编辑画布:OOXML 到 LLM 摄取中的证据分歧
Beyond the Editing Canvas: Evidence Divergence in OOXML-to-LLM Ingestion
摘要
LLM 管道越来越多地摄取 Office Open XML (OOXML) 文档(Word、Excel 和 PowerPoint 文件)作为财务、合规性和检索增强工作流程中的一流证据,隐含地假设语义完整性:模型使用的证据与 Microsoft Office 套件编辑画布中显示的内容相匹配。我们证明这种假设在 OOXML 到 LLM 管道中可能会失败。同一规范有效的 OOXML 文件可以在 Microsoft Office 中生成一个证据视图,在为 LLM 提取时可以生成另一个证据视图。每个视图都被其消费者视为权威,我们将这种情况称为复数 真值。摄取合同很少说明哪些视图和语义角色成为模型证据或保留该证据的导出方式。我们将引发此类分歧的基于规范的 OOXML 结构称为证据分叉。我们系统地遍历和挖掘了 OOXML 规范,并确认了跨 Excel、Word 和 PowerPoint 的 21 个证据分叉,跨越了视图构建的六个维度。我们的提取面板中的所有 13 种工具都至少从一个叉子中发出证据。我们测试了四个本机摄取 LLM API 和七个网络聊天机器人。每个测试文档都带有一个陷阱:通过提取暴露但未在 Office 中显示的与任务相关的事实。在这项 21 种机制的评估中,四种 API 在 48--76% 的试验中返回了陷阱。对于 21 种机制中的 20 种,11 个接口中至少有一个返回陷阱。我们的测量进一步表明,暴露是由模型上游的摄入路径和提取器配置决定的。对 16 个流行的开源 LLM 项目的源代码级调查进一步表明,默认的 OOXML 摄取路径集中在受影响的提取器系列上。