论文
使用 LLM 生成数据质量规则
Data Quality Rule Generation with LLMs
摘要
数据(例如客户和员工数据)的验证是许多组织的一项重要任务。数据错误可能会造成严重后果。例如,患者记录中的错误药物单位可能会导致危及生命的用药错误,而地址中缺少街道号码可能会导致送货失败。公司通常采用基于规则的企业数据质量 (DQ) 工具,该工具允许领域专家指定规则来随着时间的推移验证数据。虽然基于规则的 DQ 工具计算效率高并提供可解释的报告,但手动维护全面的规则集具有挑战性,因为领域专家经常忽视基本规则,尤其是在复杂领域和大数据量中。因此,缩小这些差距在实践中仍然是一个悬而未决的问题。在本文中,我们解决了自动 DQ 规则生成的挑战。为此,我们形式化了一个通用的生成过滤器框架,并引入了 LeDQeR,一种基于 LLM 的 DQ 规则生成方法。首先,大语言模型 (LLM) 根据给定的基于规则的 DQ 工具语法从观察到的脏数据元组生成候选规则。其次,我们应用四种过滤技术来确保(i)可执行性,(ii)正确性和(iii)通用性,并避免(iv)生成规则的冗余。广泛的实验评估表明,LeDQeR 能够为各种数据集和错误类型生成有效且紧凑的规则集。