论文
Logics-Parsing-Omni技术报告
Logics-Parsing-Omni Technical Report
摘要
针对多模态解析中任务定义碎片化与非结构化数据异构性的挑战,本文提出Omni Parsing框架。该框架建立覆盖文档、图像与音视频流的统一分类体系,引入衔接感知与认知的渐进式解析范式。具体而言,框架整合三个层级:1)整体检测,实现对象或事件的精确时空定位,为感知建立几何基线;2)细粒度识别,对局部对象执行符号化(如OCR/ASR)与属性抽取,完成结构化实体解析;3)多层解读,构建从局部语义到全局逻辑的推理链。该框架的关键优势是证据锚定机制,它强制高层语义描述与底层事实严格对齐。这使「基于证据」的逻辑归纳成为可能,把非结构化信号转化为可定位、可枚举、可追溯的标准化知识。在此基础上,我们构建了标准化数据集并发布Logics-Parsing-Omni模型,成功将复杂音视频信号转换为机器可读的结构化知识。实验表明细粒度感知与高层认知相互协同,有效提升模型可靠性。此外,为定量评估这些能力,我们提出OmniParsingBench。代码、模型与基准发布于https://github.com/alibaba/Logics-Parsing/tree/master/Logics-Parsing-Omni。
