论文

SynthAVE:通过 LLM-Arena 验证实现电子商务的可扩展合成标签

SynthAVE: Scalable Synthetic Labeling for E-Commerce with LLM-Arena Validation

模型训练合成数据

摘要

用于电子商务属性提取的 微调 大语言模型 (LLM) 需要代表数千种产品类型、属性和多种语言的标记数据。这种组合规模可转化为数百万个注释,使得人工标记成本高昂。虽然最近的工作已经证明使用 LLM 生成合成标签,但在工业规模上部署此类方法需要集成的质量控制机制。我们推出 SynthAVE,这是一个用于属性值验证的大规模基准,涵盖 229 个产品类型、792 个属性和 4 种语言(西班牙语、法语、意大利语、德语)的 12,726 种产品。为了大规模验证合成标签,我们引入了一个多 LLM 竞技场框架,其中每个样本由 21 个法官配置(7 个模型系列 $\times$ 3 个提示)进行评估,最终标签通过多数投票确定;对合成标签的分歧由专家裁决,协议案件则根据分层样本进行审核。多数投票团体同意科恩的专家标签 $κ= 0.92$(95.0% 一致),而个别评委之间的同意程度较低(弗莱斯的 $κ= 0.76$)——这是有意为之,因为我们选择的是多样性。这表明,具有不同个人判断的不同模型聚合成高度可靠的预测,从而实现大规模的具有成本效益的验证,同时将专家的努力集中在改变标签的情况上。我们估计最终的标签质量为 97.9%。