论文
CoHyDE:面向工具检索的LLM改写器与稠密编码器迭代式协同训练
CoHyDE: Iterative Co-Training of LLM Rewriter & Dense Encoder for Tool Retrieval
摘要
在大型API目录上进行工具检索是LLM智能体的核心瓶颈:用户查询以口语化、常常欠规范的语言到来,而目录使用技术性API词汇,任何固定编码器都无法独自弥合这一鸿沟。两种主流训练方法——对比式编码器微调与使用冻结LLM的HyDE式查询扩展——从两端入手解决该问题,却以互补的方向失败:微调后的编码器在查询表面形式与目录匹配时表现出色,不匹配时性能崩溃;零样本HyDE对欠规范查询更稳健,却会生成不了解目录内容的假设性描述,当查询本身规范良好时反而损害检索。我们提出CoHyDE,一种将稠密编码器与LLM改写器作为单一共同演化系统训练的迭代流程:编码器基于改写器生成的目录风格假设性描述用InfoNCE重训,改写器则依据编码器的检索得分通过DPO进行偏好对齐,且双方在循环开始前先在工具目录上热启动。在ToolBench目录约1万工具的子集上,三轮CoHyDE在标准查询上比最强单组件基线提升2.5个百分点NDCG@5,在留出的模糊查询上提升6.3个百分点,在最难的模糊层级上增益高达8个百分点。消融实验证实协同训练是关键要素:单独使用任一组件在规范查询与模糊查询上均无法匹敌CoHyDE,模糊查询上的差距最大达8个百分点。