论文

CASTLE:冷启动自然语言搜索的对比和种子引导训练

CASTLE: Contrastive and Seed-Guided Training for Cold-Start Natural Language Search

模型训练合成数据

摘要

部署自然语言搜索系统面临着严峻的冷启动挑战:没有真正的用户查询来学习语言模式,也没有相关标签来训练排名模型。我们推出了 CASTLE(自然语言搜索的对比和种子引导训练),这是一个基于 LLM 的框架,用于从结构化目录数据生成合成查询和相关标签,为 Airbnb 的自然语言搜索提供整个生命周期的支持。 CASTLE 做出了三项贡献。首先,我们通过将结构引导的提示与来自用户研究的种子查询相结合,使用模板、少样本和基于属性的提示变体以及显式的多样性机制来生成真实的查询,以防止查询崩溃。其次,我们通过从预订会话中导出的对比列表对来构建相关性标签,在没有 LLM 判断的情况下实现接近零的误报。第三,CASTLE 的结构化输入设计非常灵活:将更丰富的信号(例如客人评论和照片说明)与列表属性结合起来,可以生成反映主观用户偏好的利基长尾查询(例如,“带壁炉的舒适小屋”),超出了目录属性本身所能表达的范围。与 InPars 风格、Promptagator 和仅对比基线相比,CASTLE 与真实用户相比实现了 KL 1.01,比最佳基线 (9.33) 提高了 9.2 倍,并且属性类型 KL 散度最低 (0.08),甚至优于调查种子查询 (0.09)。对 200 个三元组样本的人工评估证实了标签质量:注释者对 CASTLE 标签的同意率为 91-93%。我们部署生产管道,每天生成合成示例,用于基于嵌入的检索和排名评估。综合数据在冷启动之外仍然有价值:它针对有机流量中代表性不足的尾部查询,并自然地扩展到多轮会话搜索。