论文

与两位信心十足的当地LLM评审一起策划商户匹配培训数据

Curating Merchant-Matching Training Data with Two Confidence-Gated Local LLM Judges

模型训练合成数据

摘要

商户匹配将嘈杂的支付描述符解析为检索到的商户实体或返回不匹配。策划培训标签的一个关键挑战是将教师弃权与不存在可接受实体的证据区分开来:错误的不匹配标签会污染伪标签数据,而保守的标签会减少覆盖范围。我们研究两个本地大语言模型判断之间的一致性是否提高了伪标签的可靠性。仅当评审同意时才会保留标签,并为选择和弃权设置单独的有序阈值,以保证正负标签集不相交。对 2,000 个专家注释查询的回顾性重播表明,较高的选择阈值可以提高阳性标签纯度,而较高的弃权阈值会增加错误的不匹配标签。在阈值(0.86、0.80)下,Muse Glimmer 30B 和 Gemma 4 31B 联合标记了 1,633 个查询(覆盖率 81.7%),纯度为 96.88%;正负纯度分别为99.47%和93.38%。这比相同阈值下的任一成分模型高出两个以上百分点,但覆盖范围较低。对半检查发现只有 0.14 个百分点的阈值选择乐观度。 0.86 的对称阈值会添加 40 个错误的不匹配标签,而即使没有置信阈值,也会有 46 个错误弃权。在五次匹配的模型内比较中,较高的推理工作量不会产生明显的 F0.5 增益,并且中值延迟会增加 1.8-5.0 倍。这些结果促使对阳性和阴性伪标签进行单独的阈值设置和审核。该研究确定了标签的纯度,而不是学生的效用;为了展示下游价值,新数据管理和学生微调仍然是必要的。