联合训练还不够:多模式文档理解的条件跨粒度训练
Joint Training Is Not Enough: Conditioned Cross-Granularity Training for Multimodal Document Understanding
摘要
相互强化效应 (MRE) 询问当一个模型同时处理精细的、跨度级别的任务和粗略的、文档级别的任务时,两者是否相互帮助。我们在三个语料库、两个收据和一个扫描的商业表格上的多模式文档理解中对其进行测试,比较单任务、联合和条件训练,仅在训练期间将一种粒度的标准输出置于另一种粒度的提示中。我们构建了 Doc-MRE,一个将标准字段提取(点)与四个文档级方面(线)配对的注释层,由三名法官 LLM 委员会在预注册下构建,并通过盲重新注释进行验证。一个预先确定的谓词:在一个共享的方案中,如果一个机制在两个粒度上都击败了匹配的单任务模型,那么它就会得到强化。混合联合训练(之前的 MRE 工作假设的安排)在主要规模上没有语料库上得到强化:它低于 CORD 上的两个单任务模型,并在另外两个模型上用一种粒度换取另一种粒度,就像单任务调优一样。条件训练强化了三者中的两个,CORD(+0.5 点,+4.8 线)和形式语料库(+7.2 点,+11.0 线),可解决粗略一侧和定向精细一侧,并在 WildReceipt 上进行交易;在这个配方上,没有任何替代方案可以在任何地方击败它。两个字节相同的提示控件将内容与格式分开:混洗调节破坏了粗略的技能,但精细方面的成本要低得多,而中性内容控制在 WildReceipt 上再现了整个精细方面的增益,因此它是提示结构,但在其他两个上买不到任何可解析的东西。在形式上,语料条件可以避免崩溃:混合训练和中性控制都为所有 50 个测试文档分配多数语义标签;只有调节才能恢复标准分布。探测器发现信息在每种情况下都是可解码的,并且在条件条件下没有可解决的增加。