论文
RecHarness:用于自我进化推荐系统的强盗路由代理工具
RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems
摘要
优化现代推荐模型仍然在很大程度上依赖于工程师手动迭代架构、目标和训练策略的变化。虽然基于 LLM 的代理可以自动执行此试错过程,但允许 LLM 选择修改方向并生成具体假设通常会导致在有限的实验预算下搜索不稳定。受上述挑战的启发,我们提出了 RecHarness,一种用于自动推荐模型优化的 Bandit-Route Agentic Harness。 RecHarness 将优化过程分为两个步骤:强盗路由器根据历史验证反馈选择下一个修改方向,而 LLM 生成具体的优化假设并在所选方向内进行可执行代码编辑。为了维持长期探索,RecHarness 使用跳盆机制在本地编辑停滞时激活结构跳臂。在多个推荐任务、数据集和模型主干上,RecHarness 比 LLM 推理搜索实现了更稳定的性能改进,并更有效地利用有限的试验预算。在某大型短视频广告平台进行的为期7天的在线A/B测试中,所选候选广告的ADVV提高了2.084%,Revenue提高了0.534%,Exposure提高了0.559%。代码可在 https://github.com/6lyc/RecHarness 获取。