论文

通过非对称编码器进行基准测试并实现高效的中文医学检索

Benchmarking and Enabling Efficient Chinese Medical Retrieval via Asymmetric Encoders

应用与实践行业应用

摘要

有效的医学文本检索需要高精度和低延迟。虽然基于 LLM 的嵌入模型具有强大的检索能力,但其令人望而却步的延迟和高计算成本限制了其在实时场景中的应用。此外,缺乏全面和高保真度的基准阻碍了中文医学文本检索的进步。在这项工作中,我们介绍了中文医学文本嵌入基准(CMedTEB),该基准涵盖三种实际嵌入任务:检索、重新排序和语义文本相似性(STS)。与纯自动化数据集不同,CMedTEB 通过经过临床专家验证的严格的多 LLM 投票管道进行策划,确保专家核验的标签质量,同时有效减轻注释噪音。在此基础上,我们提出了中国医学非对称 检索器 (CARE),这是一种非对称架构,它将用于在线查询编码的轻量级 BERT 式编码器与用于离线文档编码的强大的基于 LLM 的编码器配对。然而,使用两个结构不同的编码器优化这种不对称 检索器 提出了独特的挑战。为了解决这个问题,我们引入了一种新颖的两阶段训练策略,逐步连接查询和文档表示。大量实验表明,CARE 超越了 CMedTEB 上最先进的对称模型,在不增加推理延迟的情况下实现了卓越的检索性能。