论文
RecSys Factory:在工业推荐系统生命周期中将LLM智能体自主性约束至决策点
RecSys Factory: Bounding LLM Agent Autonomy to Decision Points in the Industrial Recommender Lifecycle
摘要
将LLM智能体部署到工业推荐系统运维中,暴露出一个我们称为自主性-确定性-效率三难困境的三方张力:通用自主性(解读运营者意图、零样本生成胶水代码)、工业确定性(符合模式约束的特征抽取、不崩溃的A/B测试、零合规路径幻觉)与端到端效率。三者中任意两个都能以牺牲第三个为代价被最大化。我们提出RecSys Factory,一个在腾讯三条异构推荐业务线上部署78天的LLM智能体平台。设计原则是“在决策点上自主,而非在整个管线上自主”,通过三项解构加以具体化,每项解构卸下三难困境的一个顶点。运行时被解构为三个由宿主发出的事件源(Claude Code Stop钩子、企业IM webhook、工作流调度器API):平台在等待阶段不携带任何常驻守护进程,在94%的等待Spark或GPU作业的墙钟时间里消耗零CPU。能力被解构为一个29文件的技能生态(8,971行SKILL.md),其每技能陷阱表被机械地编译为400条目的PitfallStore,把自主性约束在预先承诺管线内部的有界类型化决策面上。部署横跨三条标签语义、A/B层拓扑与运营者画像互不相同的业务线;三条线中有两条观察到接入时间压缩,该结果作为案例研究观察报告,而非泛化主张,也未对照平台启用前的受控基线进行测量。人通过人在回路的卡片协议被保留在诊断与执行的边界上,该协议作为审计原语(模式校验、幂等、可回放)部署,并来自一个8天16次运行的试点。在78天窗口内,平台记录了1,624次CLI工具调度,总成功率为78.6%。
