论文

全球提炼,本地化:推理 蒸馏 和产品类型测试时训练以实现可扩展的换购建议

Distill Globally, Adapt Locally: Reasoning Distillation and Product-Type Test-Time Training for Scalable Trade-Up Recommendation

摘要

以旧换新建议可识别更高质量的替代品,在提供升级优惠的同时保留客户的购买意愿。 大语言模型 (LLM) 可以推断出此类区别,但将它们直接应用于数亿个产品对在操作上是不切实际的。我们引入了一个两级框架,将 LLM 推理提炼为高效的非生成学生,并使其决策边界适应特定于产品类型的换购标准。在第 1 级,检索增强的小样本 LLM 教师生成结构化关系标签和自然语言基本原理。这些基本原理通过对齐和对比目标来监督紧凑的嵌入对分类器;推断时,学生仅使用两个预先计算的 768 维乘积嵌入,没有 LLM 调用或文本生成。在 8,352 对固定的人工注释基准上,1550 万参数的四类推理蒸馏学生的 AUC 为 0.924(95% CI [0.918, 0.929]),而仅四类标签学生的 AUC 为 0.912。在第 2 级,产品类型测试时训练 (PT-TTT) 使用少量演示来优化冻结学生的轻量级特定类别适配器。 PT-TTT 将 AUC 从 0.924 提高到 0.941,平均精度从 0.920 提高到 0.940。在 10 万对代理目录上,单个 8 GPU 机器上的精炼学生比直接 LLM 推理快大约 5,000 倍,估计成本低 10,000 倍。