论文

更好的检索,有限的聚类增益:多语言公司实体解析的对照研究

Better Retrieval, Limited Clustering Gains: A Controlled Study of Multilingual Company Entity Resolution

上下文与知识检索增强

摘要

当配对分类器保持不变时,改进的名称检索可能对公司集群影响不大。我们通过在固定候选预算和下游决策规则下调整多语言 E5 编码器来检查这种依赖性。随机阴性和硬阴性训练使用相同的阳性时间表。在收集包含 3,633 个姓名、2,880 个来源身份和 882 个银阳性对的新 GLEIF 样本之前,先选择检查点。在 72,660 个候选边缘处,多视图选择器的自适应将直接对召回率从 53.74% 增加到 76.98%。主匹配器只添加了七个正确的和两个错误的共簇对:簇召回率从 32.54% 上升到 33.33%,而精度从 95.99% 下降到 95.45%。在 208 个新检索到的白银阳性货币对中,有 202 个低于其决策阈值。随机负数和硬负数训练产生相同的最终分区。对 137 对的 AI 辅助单一审核员审核支持了观察到的模式,尽管其主要源自 LEI 的证据并未建立独立的参考标签。结果定位了现有确认阶段检索增益的直接损失,并说明了为什么编码器评估还必须测量最终的集群质量。