论文

Logics-Parsing-Omni技术报告

Logics-Parsing-Omni Technical Report

模型训练监督微调与指令调优

摘要

针对多模态解析中任务定义碎片化与非结构化数据异构性的挑战,本文提出Omni Parsing框架。该框架建立覆盖文档、图像与音视频流的统一分类体系,引入衔接感知与认知的渐进式解析范式。具体而言,框架整合三个层级:1)整体检测,实现对象或事件的精确时空定位,为感知建立几何基线;2)细粒度识别,对局部对象执行符号化(如OCR/ASR)与属性抽取,完成结构化实体解析;3)多层解读,构建从局部语义到全局逻辑的推理链。该框架的关键优势是证据锚定机制,它强制高层语义描述与底层事实严格对齐。这使「基于证据」的逻辑归纳成为可能,把非结构化信号转化为可定位、可枚举、可追溯的标准化知识。在此基础上,我们构建了标准化数据集并发布Logics-Parsing-Omni模型,成功将复杂音视频信号转换为机器可读的结构化知识。实验表明细粒度感知与高层认知相互协同,有效提升模型可靠性。此外,为定量评估这些能力,我们提出OmniParsingBench。代码、模型与基准发布于https://github.com/alibaba/Logics-Parsing/tree/master/Logics-Parsing-Omni。

Logics-Parsing-Omni技术报告:论文配图
图1:Logics-Parsing-Omni在OmniParsingBench上的性能表现,展示其文档解析能力相对其他方法的对比优势。