论文
野外主题匹配:现实世界 ASR 文字记录的基准和经验教训
Topic Matching in the Wild: Benchmark and Lessons from Real-World ASR Transcripts
摘要
在联络中心,实时座席辅助工具针对许多预定义主题中的每一个确定实时客户话语是否相关,并在相关时向座席显示指导卡。输入嘈杂且具有挑战性:自发电话对话的 ASR(自动语音识别)转录,可能不清楚、重复,并且大多缺乏标点符号。为了系统地研究这个现实世界的任务,我们策划了一个来自真实呼叫中心记录的人工注释的主题话语判断数据集。我们比较了三种类型的匹配器:基于正则表达式的基线、零样本句子嵌入编码器和基于 Gemini 的 LLM 匹配器。此外,我们的基准测试还研究了两种类型的主题表示:关键短语和自然语言描述。我们的实证实验强调了轻量级 LLM 匹配器在配备自然语言描述时优于嵌入和正则表达式模型的性能。