论文

减少验证、增加探索:训练想法级评论模型辅助机器学习Agent改进

Verify Less, Evolve More: Training Idea-Level Critics for Verification-Efficient ML Evolving Agents

模型训练智能体系统监督微调与指令调优强化学习奖励建模与过程监督智能体自我改进

摘要

随着大型语言模型变得更加强大,自我进化Agent能够解决具有挑战性的任务,包括机器学习人工智能 (AI4ML)。在 AI4ML 中,虽然可以进行实证验证,但通常需要计算成本高昂的模型训练和评估,限制了智能体进化的速度和规模。然而,验证效率仍未得到充分探索,而前沿模型在直接用作想法选择器时只能提供有限的收益。我们通过专门的想法级批评模型来解决这一差距,该模型可以预测提议的 ML 修改是否会改进当前的解决方案,从而允许Agent筛选想法并将验证资源集中在最有希望的候选者上。我们通过对 Gemini-3.1-Pro 合成的高质量评论进行监督微调来训练评论家模型,然后通过 GRPO 进一步提高其预测准确性。根据经验,我们的Critic模型在静态想法评估方面优于 Gemini-3.1-Pro,并且这些收益扩展到智能体推理、持续学习和策略培训。在推理时间演化过程中,他们通过选择更有前途的想法,在相同的验证预算下提高最终解决方案的质量,并从持续学习中获得进一步的收益。在策略训练期间,它们充当学习奖励模型,为不确定的情况保留经验验证,并使用相同的验证资源实现更多的策略更新。总之,这些结果表明,想法级Critic模型可以帮助机器学习Agent在有限的验证预算下发现更好的解决方案并学习更强大的提案策略。

减少验证、增加探索:训练想法级评论模型辅助机器学习Agent改进:论文原图
图 2:我们的创意级筛选流程概述。给定一个 ML 任务、一个父解决方案和一个候选想法,批评模型会预测该想法是否会改进父想法。仅对预计会改进的想法进行实证验证,从而减少昂贵的验证。