论文

超越精确匹配:评估方法如何主导基于 LLM 的产品属性提取中的模型选择

Beyond Exact Match: How Evaluation Methodology Dominates Model Choice in LLM-Based Product Attribute Extraction

模型评测评测方法与指标

摘要

大语言模型 (LLM) 已成为电子商务管道中结构化产品属性提取的默认选择,从业者报告的模型、数据集和提示策略之间的性能差异很大。本文提出了一项受控实证研究,比较了 MAVE 基准上两个生产级 LLM(GPT-4o-mini 和 Gemini 2.5 Flash)的四种提示策略(零样本、少样本、模式引导和定义增强)。我们使用精确和模糊字符串匹配来评估 6,400 个属性级预测,并对 真值 标签进行严格的噪声审核。我们正式分解四个实验因素的 F1 方差,发现评估方法产生的方差大约是模型选择的 23 倍,是提示策略选择的 5 倍。我们进一步确定,与现代 LLM 输出相比,MAVE 基准测试的 真值 噪声率为 23.2%。配对排列检验 (B=10,000) 证实协议间 F1 差距非常显着 (p<0.0001),并且协议之间的 Cohen kappa 为 0.769,表明基本一致。我们的结论是,对于生产属性提取管道,评估方法和数据质量主导着模型选择和提示工程的影响。