论文

Astar:学习为自我进化的工业人工智能系统提出进化方向

Astar: Learning to Propose Evolution Directions for Self-Evolving Industrial AI Systems

模型训练强化学习

摘要

现代人工智能系统通过不断迭代来进步:提出进化方向、实施代码、训练和评估的循环。虽然后三个阶段日益自动化,但起点——提出有效的演进方向——仍然是一个关键瓶颈,仍然严重依赖资深专家。在这项工作中,我们探索人工智能是否可以接管这个角色。我们发现通用的 LLM,即使是先进的 GPT-5.5,也只提供通用且不一致的建议:所需的专业知识是通过经验积累的,而不是明确编码的,因此很难直接注入。为此,我们提出了 Astar,一种基于训练的方法,从工业系统丰富的迭代历史中学习专门的进化指导模型。然而,实现这一想法提出了四个挑战:稀疏的监督、嘈杂的数据、巨大的方向空间以及极其昂贵的验证。我们从两个方面解决这些问题。在数据方面,我们设计了一个管道,通过成对样本扩展和噪声过滤,将嘈杂的历史提交转化为大型、干净的进化语料库。在模型方面,我们通过中期训练、SFT 和 RL 来训练模型,用分层提示指导进化方向生成,并使用 RL 中的奖励模型作为快速代理评估器。 Astar已部署在阿里巴巴Lazada广告系统中,用于演进方向提案。 Astar-8B在实际执行评估中取得了0.6786的单次提案成功率,远超人类专家(0.3229)和最强通用LLM(0.3071)。更重要的是,Astar实现了闭环并实现了全自动迭代:它在两周内引导了连续20次迭代,将离线Hitrate@200提高了23.6%,而在线A/B测试则使GMV相对提升了4.86%,广告收入相对提升了1.82%。