论文

试点技术报告

PILOT Technical Report

智能体系统Agent 架构与控制循环

摘要

现有的推荐系统优化代理方法基本上仍然是反应性的:它们根据观察到的指标变化调整参数,但缺乏主动设计受控实验、在用户细分级别个性化策略或跨任务积累可重用实验方法的能力。我们提出了 PILOT(在线树实验的主动洞察学习器),这是一个 LLM 代理框架,它在受约束的控制循环中组织了三个角色,其中确定性服务强制执行所有安全、统计和权限边界:(1)实验管理器,通过仅从规则生成的合法命令信封中进行选择来驱动整个实验生命周期——任务接收、观察治理、异常恢复和事后分析; (2) 搜索规划器,为用户段级个性化建议候选决策树,仅在管理器请求规划时调用; (3) 内存管理器,将实验结果异步提炼为策略级领域知识和来源跟踪方法,与主循环故障隔离。管理器使代理积极主动,规划器使人口级别的个性化超越全局调整,而策展人将每一个已完成的任务转变为下一个任务的学习机会。 PILOT 部署在淘宝平台上,有 5 个实验桶,与 ROAM(代理驱动移动的反应式优化)进行比较,ROAM 是一种自由探索代理,没有生命周期治理或结构化假设检验。 PILOT 实现了高达 +1.40% IPV、+1.60% 核心 IPV、+0.96% 交易次数和 +1.50% 交易金额,比 ROAM 的最佳结果(+1.00% IPV、+0.90% 核心 IPV、+0.60% 交易次数、+1.13% 交易金额)有所提高,同时将搜索效率从 53.3% 提高到 93.3%(+40 个百分点),整个实验周期没有人为干预。