论文
A-MLE:广告排序中的Agentic机器学习探索
Agentic ML Exploration (A-MLE) for Ads Ranking
摘要
现代工业广告排名堆栈越来越成为瓶颈,不是模型容量或训练计算,而是人类机器学习迭代的吞吐量——显示单个统计显着改进所需的研究、实施、训练、调试、评估和发布的周期。典型的排名堆栈包含许多具有异构数据、架构和基础设施限制的差异化模型,每个周期需要高级工程师几天到几周的时间关注每个模型。因此,在一种模型上已被证明有效的技术会缓慢且不均匀地扩散到其他模型中,从而留下大量未开发的可恢复信号。我们推出了 Agentic ML Exploration (A-MLE),这是一个自主的 LLM 智能体系统,可以跨广告排名模型组合系统地探索 ML 技术。 A-MLE 将机器学习迭代分解为五个阶段,涉及假设生成、探索策略、实验执行、结果分析和共享知识基础,这些阶段由单个智能体精心编排,该智能体针对沙盒执行层调用特定于领域的技能和智能体工作流程,并在每个阶段边界设有人机循环检查点。我们在一组具有代表性的大规模广告排名模型中部署 A-MLE,并根据分层功能框架(工具可用性、自主工作流程执行和开放式探索)对其进行评估。我们进一步报告了一项使用固定智能体循环的受控跨大语言模型研究,该研究揭示了 Claude Sonnet、Gemini 和 GPT 系列在执行可靠性和探索积极性方面的定性差异。我们讨论失效模式和控制可靠性的设计选择。我们的研究结果表明,智能体探索对于工业推荐中的机器学习工程师来说是一个实用的力量倍增器,特别是对于很少受到专家关注的长尾模型。