论文

使用 大语言模型 发现数据湖中的关系:工业案例

Discovering Relationships in Data Lakes Using Large Language Models: An Industrial Case

应用与实践结构化分析、预测与决策

摘要

数据湖依靠元数据来保持可用,但这些元数据对于列关系发现来说通常是有限的或信息量很弱,特别是在具有编码或缩写模式标签的 ERP 派生数据集中。我们提出了 ColRel,这是一种两阶段方法,可以根据元数据和摄取时可用的数据构建列嵌入。在困难的情况下,例如编码模式,业务词典有助于更好地解释列名称并支持生成第二阶段使用的简短自然语言描述。对公共基准和工业 ERP 数据集的实验表明,ColRel 在语义相关的弱信号设置中特别有效。