论文

基于 LLM 的行业规模推荐系统的高效聚类和质量护栏

Efficient Clustering with Quality Guardrails for LLM-based Recommender Systems at Industry Scale

AI 基础设施推理服务

摘要

LLM 的大规模运行可能非常昂贵且缓慢,特别是对于在数百万个输入上每个样本调用 LLM 的应用程序。一种自然的扩展方式是对输入进行集群,仅在集群代表上运行 LLM,并将输出传播到其他集群成员。然而,成员收到的输出仅与其与代表的匹配程度一样好。现成的聚类方法优化了总体目标,以平均案例质量为目标,无需针对每个样本进行防护。因此,成员可能会被分配给不匹配的代表,而继承的输出(尽管适合代表)可能与成员无关,甚至不安全。例如,幼儿的父母与年龄较大的孩子的父母分组可能会收到不适合年龄的建议。大多数聚类方法在运行时和内存中也很难扩展到数百万个输入,从而限制了它们在工业规模上的使用。我们提出了一种可扩展的两阶段聚类算法,具有可证明的每样本护栏:保证每个样本与其代表共享用户指定的最小嵌入相似性和精确的属性匹配。该算法首先使用小批量 K 均值生成初始聚类,然后贪婪地选择每个聚类中的代表以满足护栏要求。我们提供理论保证、复杂性分析以及针对内部和公共数据集上的常用方法的基准。我们的方法提供了每个样本的护栏,同时运行速度大大加快,并扩展到大多数标准方法都难以处理的数据大小。我们展示了它对 3800 万客户的实际部署集群的影响,将下游 LLM 成本和运行时间降低了 50 倍,同时保留了个性化。这使得基于角色的推荐系统的推出畅通无阻,该系统在收入和 A/B 测试参与度方面带来了显着的收益。