论文

AgentX中的模型研究进展:面向工业推荐系统的长程自主

Advancing Model Research in AgentX: Long-Horizon Autonomy for Industrial Recommender Systems

智能体系统Agent 协作

摘要

维系工业推荐研究需要利用一个实验的结果来决定下一步研究什么。我们提出AgentX-Model,AgentX模型研究框架的下一代,它在由业务输入和预测任务定义的沙盒中连接提案开发与模型实验。AgentX-Model采用双智能体架构,包括研究智能体和模型智能体。研究智能体从论文和实验发现中发展经独立审查的提案,而模型智能体进行多轮研究并返回代码、测量结果和未解决问题。研究智能体利用返回的结果选择起始实现并表述下一个研究问题,使后续实验建立在早期发现之上。我们把这一持续研究组织为四种行动:复现、跟进、组合和诊断。前三种行动驱动常规研究,而诊断获取选择修复所需的证据,包括针对业务反馈和在线评估提出的问题,如以PCOC衡量的预测偏差。在生产评测中,636个完成的改动模型的实验中有560个记录到AUC高于其业务基线。随着研究继续,一些实验记录到的AUC高于其谱系中每个可比祖先。跨不同业务设置的最新五次在线A/B评估报告了获取效率提升10-15%、目标细分广告花费提升15-20%、观看时长提升0.3-0.8%的收益;观看时长模型使用的FLOPs和参数约少10%。一个依赖感知的历史回放基准进一步评估研究分配,初步结果显示当智能体已经分析并选择具体候选时,更复杂的调度并无一致的效率收益。