论文

RecSys Factory:在工业推荐系统生命周期中将LLM智能体自主性约束至决策点

RecSys Factory: Bounding LLM Agent Autonomy to Decision Points in the Industrial Recommender Lifecycle

智能体系统Agent HarnessAgent Skills

摘要

将LLM智能体部署到工业推荐系统运维中,暴露出一个我们称为自主性-确定性-效率三难困境的三方张力:通用自主性(解读运营者意图、零样本生成胶水代码)、工业确定性(符合模式约束的特征抽取、不崩溃的A/B测试、零合规路径幻觉)与端到端效率。三者中任意两个都能以牺牲第三个为代价被最大化。我们提出RecSys Factory,一个在腾讯三条异构推荐业务线上部署78天的LLM智能体平台。设计原则是“在决策点上自主,而非在整个管线上自主”,通过三项解构加以具体化,每项解构卸下三难困境的一个顶点。运行时被解构为三个由宿主发出的事件源(Claude Code Stop钩子、企业IM webhook、工作流调度器API):平台在等待阶段不携带任何常驻守护进程,在94%的等待Spark或GPU作业的墙钟时间里消耗零CPU。能力被解构为一个29文件的技能生态(8,971行SKILL.md),其每技能陷阱表被机械地编译为400条目的PitfallStore,把自主性约束在预先承诺管线内部的有界类型化决策面上。部署横跨三条标签语义、A/B层拓扑与运营者画像互不相同的业务线;三条线中有两条观察到接入时间压缩,该结果作为案例研究观察报告,而非泛化主张,也未对照平台启用前的受控基线进行测量。人通过人在回路的卡片协议被保留在诊断与执行的边界上,该协议作为审计原语(模式校验、幂等、可回放)部署,并来自一个8天16次运行的试点。在78天窗口内,平台记录了1,624次CLI工具调度,总成功率为78.6%。

RecSys Factory:在工业推荐系统生命周期中将LLM智能体自主性约束至决策点:论文配图
图1.1:工业级 LLM 智能体的自主性–确定性–效率三难困境。每个顶点标示一个设计目标;每条边标示固定该边时的失效模式(等价地,即舍弃对面顶点)。三个顶点在单一强制性资源下相互竞争——即每条业务线的工程投入与人工监督预算(在腾讯规模下每条新业务线约\approx3–6 人月,外加每月 40–80 小时评审时间)——这正是它们两两冲突、而非三个独立旋钮的原因。RecSys Factory 选择了一个内部折中点而非最大化任一顶点,并为平台构建度量以使该折中清晰可见;内部折中原则将三难困境化简为 §3–§6 中所述的三项具体工程承诺。