论文

Ostrakon-VL:迈向面向餐饮与零售门店的领域专家MLLM

Ostrakon-VL: Towards Domain-Expert MLLM for Food-Service and Retail Stores

模型训练合成数据

摘要

多模态大语言模型(MLLM)近来在通用感知和推理方面取得长足进展。然而,其在餐饮与零售门店(FSRS)场景中的部署遇到两大障碍:(i)从异构采集设备收集的真实FSRS数据噪声大,缺乏可审计的闭环数据治理,阻碍构建高质量、可控、可复现的训练语料;(ii)现有评估协议未提供覆盖单图、多图和视频输入的统一、细粒度、标准化基准,使客观衡量模型鲁棒性变得困难。为应对这些挑战,我们首先开发Ostrakon-VL,一个基于Qwen3-VL-8B的面向FSRS的MLLM。其次,我们推出ShopBench,首个公开的FSRS基准。第三,我们提出QUAD(Quality-aware Unbiased Automated Data-curation),一个多阶段多模态指令数据治理流水线。借助多阶段训练策略,Ostrakon-VL在ShopBench上取得60.1的平均分,在参数规模相当、架构多样的开源MLLM中确立新的最先进水平。值得注意的是,它以+0.7超越规模大得多的Qwen3-VL-235B-A22B(59.4),并以+4.8超过同规模的Qwen3-VL-8B(55.3),展现出显著提升的参数效率。这些结果表明,Ostrakon-VL提供更稳健、可靠的FSRS中心感知与决策能力。为促进可复现研究,我们将公开发布Ostrakon-VL和ShopBench基准。

Ostrakon-VL:迈向面向餐饮与零售门店的领域专家MLLM
图1:Ostrakon-VL 总体框架。该框架包含两个核心组件:(上) QUAD,一个高质量数据整理流水线,通过质量过滤、基础模型参照过滤、多模态语义去重和能力覆盖重分配,将原始数据蒸馏为高信号语料库;(下) Training Strategy,一个多阶段过程,从通过 caption bootstrapping 进行领域知识注入开始,随后进行离线课程学习以实现渐进适应,最后以 Mixed Preference Optimization 收尾,以确保输出的稳定性与鲁棒性。