论文
大模型何时有助于数据质量标注?实体匹配与品牌错误对照
When Do LLMs Actually Help? Evaluating LLMs as Data Quality Annotators
摘要
大模型越来越多地用于自动检查数据质量,其判断一致性仍少有研究。本文在电商实体匹配与品牌错标两项任务中,对照规则基线和人工核验真值,比较零样本与少样本提示。Abt Buy的2194对实体中,规则F1为0.950,模型零样本为0.948,表现相近;看似在小验证集有效的少样本提示修订,使全量F1降至0.914,说明小样本提示评估可能误导。500条含合成错标的Amazon商品中,模型利用品牌与产品关系知识,F1为0.833,优于简单规则0.721。200对实体、温度0.7、五次运行的自一致率平均99.7%,99%的实体对五次答案完全一致;多数投票仅改善F1约0.005,却耗费五倍推理。结果表明,已有强词法线索时大模型优势小,需要背景知识时更有价值,并且重复查询通常较一致。