论文

AutoLR:工业推荐系统从研究到上线的路径自动化

AutoLR: Automating the Path from Research to Launch Review in Industrial Recommender Systems

智能体系统Agent Harness

摘要

改进工业推荐系统是一个迭代的研究和工程过程,而不是从想法到部署的直接路径。在 DASHEN,网易的游戏社区应用程序中,算法工程师通常从研究论文、技术报告和之前的生产实验中确定有前途的方向;复制或调整底层方法;在生产代码库中实现它们;并通过训练和离线实验评估生成的模型。然后,有前途的候选人将被推进在线 A/B 测试,而那些表现出强劲收益的候选人将被提交到启动审核——全流量推出的内门。大型语言模型 (LLM) 可以协助此工作流程的各个阶段,但整个过程仍然依赖于人类,没有能够在长期运行、通常是多天的实验周期中可靠地协调它们的工具。我们提出 AutoLR,最初构建为 Auto Launch Review,后来向上游扩展为自主研究到启动工具。 AutoLR 结合了三种系统机制:一个 多专家委员会,用于辩论和对抗性地审查提案;一个确定性证据加权探索——利用选择器,在候选方向上分配有限的试验预算并使用理事会重新排名;一个分层的知识系统,将外部研究、生产系统知识和 DASHEN 特定领域知识(例如游戏社区、玩家特征和内容交互模式)与来自配置、补丁、日志、故障和离线结果的后验证据相结合。 LLM 智能体执行语义推理和代码生成,而确定性控制器保留执行、度量提取、护栏和持久状态转换的权限。

AutoLR:工业推荐系统从研究到上线的路径自动化:论文配图
图 1. 本文研究的两个核心 DASHEN 推荐场景:统一的单两列 feed 和沉浸式视频 feed。两张大神手机截图并排。左侧屏幕以两列卡片布局显示社区源。右侧屏幕显示带有参与控件的全屏沉浸式视频播放器。