论文
Ostrakon-VL:迈向面向餐饮与零售门店的领域专家MLLM
Ostrakon-VL: Towards Domain-Expert MLLM for Food-Service and Retail Stores
摘要
多模态大语言模型(MLLM)近来在通用感知和推理方面取得长足进展。然而,其在餐饮与零售门店(FSRS)场景中的部署遇到两大障碍:(i)从异构采集设备收集的真实FSRS数据噪声大,缺乏可审计的闭环数据治理,阻碍构建高质量、可控、可复现的训练语料;(ii)现有评估协议未提供覆盖单图、多图和视频输入的统一、细粒度、标准化基准,使客观衡量模型鲁棒性变得困难。为应对这些挑战,我们首先开发Ostrakon-VL,一个基于Qwen3-VL-8B的面向FSRS的MLLM。其次,我们推出ShopBench,首个公开的FSRS基准。第三,我们提出QUAD(Quality-aware Unbiased Automated Data-curation),一个多阶段多模态指令数据治理流水线。借助多阶段训练策略,Ostrakon-VL在ShopBench上取得60.1的平均分,在参数规模相当、架构多样的开源MLLM中确立新的最先进水平。值得注意的是,它以+0.7超越规模大得多的Qwen3-VL-235B-A22B(59.4),并以+4.8超过同规模的Qwen3-VL-8B(55.3),展现出显著提升的参数效率。这些结果表明,Ostrakon-VL提供更稳健、可靠的FSRS中心感知与决策能力。为促进可复现研究,我们将公开发布Ostrakon-VL和ShopBench基准。
