论文
TeleEmbedBench:电信中 RAG 的多语料库嵌入基准
TeleEmbedBench: A Multi-Corpus Embedding Benchmark for RAG in Telecommunications
摘要
大语言模型 (LLM) 越来越多地部署在电信领域的关键任务中,严重依赖检索增强生成 (RAG) 来使通用模型适应不断发展的标准。然而,在评估为这些 RAG 管道提供动力的嵌入模型方面存在重大差距,因为通用基准无法捕捉电信语料库的密集、首字母缩略词密集和高度交叉引用的性质。为了解决这个问题,我们推出了 TeleEmbedBench,这是第一个专为电信设计的大规模、多语料库嵌入基准。该基准测试涵盖三个异构语料库:O-RAN 联盟规范、3GPP 发布文档和 srsRAN 开源代码库,包括跨三种标准块大小(512、1024 和 2048 词元)的 9,000 个问题块对。为了在没有手动注释瓶颈的情况下大规模构建此数据集,我们采用了一种新颖的自动化管道,其中一个 LLM 从文本块生成特定查询,而辅助 LLM 根据严格的标准验证它们。我们全面评估了八种嵌入模型,涵盖基于标准句子 Transformer 和 LLM 的嵌入器。我们的结果表明,基于 LLM 的嵌入器(例如 Qwen3 和 EmbeddingGemma)在检索精度和针对跨域干扰的鲁棒性方面始终显着优于传统句子 Transformer。此外,我们引入 TeleEmbedBench-Clean 来评估模型针对嘈杂、不完整的用户查询的稳健性。最后,我们的分析表明,虽然特定于领域的任务指令提高了原始源代码的嵌入器性能,但它们反而降低了自然语言电信规范的检索性能。