论文

多语言 OCR 感知 微调 和多模式提示引导式思维链推理 大语言模型

Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models

模型训练监督微调与指令调优

摘要

对于多模态 大语言模型 (MLLM) 来说,光学字符识别 (OCR) 和多语言场景文本理解仍然具有挑战性,特别是在包含小文本或降级文本、杂乱布局、遮挡、手写和复杂排版的现实世界图像中。我们提出了一种 OCR 感知多语言 后训练 框架,该框架改进了通用 MLLM 中的视觉文本基础,而无需外部 OCR 引擎、OCR 提取的文本或推理时的文本边界框。该框架结合了大规模多语言 OCR 监督、大约 500 万个额外的多语言训练样本、受控合成 OCR 生成和图像内文本翻译、基于 LoRA 的监督 微调 (SFT) 以及面向 OCR 的轻量级思想链提示。在真实世界的多语言 OCR 基准上,OCR-SFT 将 OCR 完整性从 71.3 提高到 84.6,将幻觉率从 18.3\% 降低到 5.5\%,并将翻译 BLEU-1 从 52.3 提高到 80.2,在模糊和旋转下显着减少幻觉。对公共基准的评估进一步显示了 OCR 密集型任务的收益,同时在很大程度上保留了更广泛的多模式能力;消融表明,SFT 提供了主要的改进,并提示提供较小的补充增益。这些结果表明,以数据为中心的 OCR 感知 后训练 提供了一种实用且可扩展的方法来改进通用 MLLM 中的多语言视觉文本基础。