论文
从合成到原生:物流客户服务中多语言意图分类的基准测试
From Synthetic to Native: Benchmarking Multilingual Intent Classification in Logistics Customer Service
摘要
多语言意图分类是全球物流平台上客户服务系统的核心,其中模型必须跨语言和分层标签空间处理嘈杂的用户查询。然而,大多数现有的多语言基准都依赖于机器翻译的文本,该文本通常比本地客户的请求更清晰、更标准化,因此可能会高估现实世界的稳健性。我们提出了一个根据真实物流客户服务日志构建的分层多语言意图分类的公共基准。该数据集包含通过过滤、LLM 辅助质量控制和人工验证从 60 万条历史记录中筛选出的约 3 万个去识别化的独立用户查询,并被组织成具有 13 个父意图和 17 个叶意图的两级分类法。英语、西班牙语和阿拉伯语被列为可见语言,而印度尼西亚语、中文和其他仅测试语言支持零样本评估。为了直接衡量合成评估和真实评估之间的差距,我们提供了配对的本机和机器翻译测试集,并在扁平和分层协议下对多语言编码器、嵌入模型和小语言模型进行基准测试。结果表明,翻译的测试集大大高估了嘈杂的本机查询的性能,特别是对于长尾意图和跨语言传输,强调了对更现实的多语言意图基准的需要。