论文

CORAL:用于生产推荐系统的 LLM-Native Harness

CORAL: An LLM-Native Harness for Production Recommender Systems

智能体系统Agent Harness

摘要

产品推荐系统塑造了数十亿人的所见,维持其性能需要持续优化:随着内容、用户行为和上游模型的变化,必须重新审视管理检索、排名和服务的选择。传统上,人类工程师通过在线实验来测试这些变化,这是一个缓慢的、反应性的过程,受到工程工作的限制,系统的某些部分随着条件的变化而不会被修改。尽管 大语言模型 已应用于排名、用户建模和离线模型开发,但很少有系统将代理置于持续闭环中,该闭环作用于实时推荐器并从其决策的测量效果中学习。我们提出了 CORAL(通过代理循环进行约束优化推荐器),这是一种 LLM 原生工具,可闭合此循环:每个周期,代理都会观察操作信号、对过去决策和结果的记忆进行推理,并调用工具(包括将更改保持在固定操作预算内的数值优化器)来重新配置推荐器,并通过测量结果通知下一个周期。我们将其表述为一个部分观察的、非平稳的、受限的优化问题,其中策略根据其先前的操作在上下文中进行改进,而无需更新参数。在两个大型社交平台中,通过 A/B 实验进行评估,相同的工具在一个平台上提高了参与度,而无需额外的服务成本,并在不降低另一个平台参与度的情况下降低了服务成本,跨越了参与效率边界。随着循环迭代,性能会提高,这表明单个代理循环可以自动执行传统上由人类算法工程师在显式护栏下执行的持续优化工作。