论文

AI-PAVE-Br:利用 大语言模型 通过金标准集方法增强产品属性值提取

AI-PAVE-Br: Leveraging Large Language Models for Enhanced Product Attribute Value Extraction through a Golden Set Approach

应用与实践行业应用

摘要

在动态的巴西电子商务环境中,产品数据的爆炸性增长和复杂性需要强大且专业的结构化信息提取方法。产品属性值提取 (PAVE) 的传统方法常常难以应对葡萄牙语产品描述的语言细微差别和多样性。为了解决这一关键差距,本文介绍了两项主要贡献。首先,我们推出 AI-PAVEBr,这是一种采用 大语言模型 (LLM) 设计的专用系统,专门针对巴西电子商务目录执行高精度 PAVE。其次,为了促进可重复的研究并提供明确的基准,我们引入并分享了 Golden Set,这是一个新的、精心策划的、手动注释的葡萄牙语 PAVE 数据集。我们详细介绍了这个高质量参考集的创建过程和结构(实体、类别、子类别)。我们的实验最终表明,AI-PAVE-Br 利用有针对性的提示工程,显着优于传统的命名实体识别 (NER) 基线。这项工作不仅为主要的非英语市场提供了卓越的、可扩展的解决方案,而且还为未来的 PAVE 研究提供了宝贵的、公开的资源,丰富了 NLP 社区。