论文

Listwise 交叉编码器 微调 与 LLM 重新排序器的代理指令调整:医疗程序重新排序的系统研究

Listwise Cross-Encoder Fine-Tuning vs. Agentic Instruction Tuning for LLM Rerankers: A Systematic Study in Medical Procedure Reranking

模型评测模型能力评测

摘要

根据患者查询重新排列医疗程序是健康保险信息检索的一个重要组成部分,由于患者语言和临床术语之间存在巨大的词汇差距而变得复杂。我们对该生产任务的两种重新排序范例进行了系统比较:(1) 小型交叉编码器(MedCPT、MiniLM-L12),通过跨层冻结配置的列表学习排序目标进行微调,以及 (2) Qwen3-Reranker-4B,一种 4B 参数指令重新排序器,其提示通过 GPT-4.1 驱动的代理优化循环进行迭代细化。在包含 708 项保险服务的 2,647 个查询的专用数据集上,我们发现使用 ListNet 进行微调的 1.09M 参数交叉编码器在 NDCG@3 上的性能优于 4B 参数模型 2.6 个百分点,在 Spearman 相关性上优于 4B 参数模型 13.3 个百分点 - 参数减少了 37 倍。我们报告了实际发现、基于可扩展 LLM 的数据集构建管道以及与生产重新排名系统相关的部署权衡。我们发布了我们的代码和示例数据集,以支持可重复性和对其他领域的适应。