论文
合并:通过生成的专家推理进行多模式实体解析 蒸馏
MERGED: Multimodal Entity Resolution via Generated Expert Reasoning Distillation
摘要
在产品实体解析中,关系定义随着业务需求不断发展,但传统上适应每次变化都需要缓慢、昂贵的人工注释,这些注释通常充满噪音且没有推理。大型视觉语言模型(VLM)促使零样本可以立即适应新的定义,并提供人类标签所缺乏的推理,但其成本和延迟在生产规模上令人望而却步。我们提出了 MERGED,这是一个 蒸馏 框架,它不仅可以将标签,还可以将结构化推理从大型教师 VLM 转移到紧凑的 7B 参数学生中,无需人工注释。多名教师为每个产品对贴上标签,并阐明其决定背后的推理:协议对提供受监督的 微调,而分歧则由元法官解决为偏好对,以进行直接偏好优化。在多语言电子商务数据集上对照人类标记的 真值 进行评估,所得学生的 PR-AUC 比在人类标签上训练的相同骨干网提高了 13.79%,并且以低 6 倍的成本超过了更大的 Qwen2.5-32B-VL 基线 6.32%,同时还产生了更严格的标签推理对齐(比 Qwen2.5-32B-VL 提高了 10% 以上)。此外,从现有检查点重新应用 MERGED 可以适应仅 10K 样本的新关系定义,与零样本相比,PR-AUC 提高了 6.97%,并且优于从头开始的训练。 MERGED 能够快速适应不断变化的关系定义,以适合大规模工业部署的成本和延迟,在几天而不是几个月内支持新的关系定义。