论文

通过并行解码扩展电子商务属性提取

Scaling E-Commerce Attribute Extraction with Parallel Decoding

上下文与知识知识获取与更新

摘要

客户依靠特定的产品属性来比较产品并做出购买决策,但电子商务目录混乱且无结构,因此很难识别哪些属性最重要并大规模提取它们。标准属性值提取 (AVE) 系统平等对待所有属性,生成大量不一致的属性集,这些属性集不能反映消费者用来区分产品的因素。我们引入了一个两阶段的 LLM 管道,它首先发现每个产品类别的紧凑、排名的购买歧视属性模式,然后使用具有超并行解码 (HPD) 的微调紧凑 LLM (Qwen3-4B) 从目录文本中提取它们的值。该管道实现了 85% 的提取精度,与从中提取的基础 LLM 相当,同时比基础 LLM 降低了 92% 的推理成本,从而实现了产品发现和目录丰富的生产规模使用。由此产生的类别级结构化表示有效地构成了自动构建的产品知识库,提供了跨不同产品类别的一致的、可比较的属性,这些属性可以为下游知识密集型应用奠定基础。