论文
减少验证、增加探索:训练想法级评论模型辅助机器学习Agent改进
Verify Less, Evolve More: Training Idea-Level Critics for Verification-Efficient ML Evolving Agents
摘要
随着大型语言模型变得更加强大,自我进化Agent能够解决具有挑战性的任务,包括机器学习人工智能 (AI4ML)。在 AI4ML 中,虽然可以进行实证验证,但通常需要计算成本高昂的模型训练和评估,限制了智能体进化的速度和规模。然而,验证效率仍未得到充分探索,而前沿模型在直接用作想法选择器时只能提供有限的收益。我们通过专门的想法级批评模型来解决这一差距,该模型可以预测提议的 ML 修改是否会改进当前的解决方案,从而允许Agent筛选想法并将验证资源集中在最有希望的候选者上。我们通过对 Gemini-3.1-Pro 合成的高质量评论进行监督微调来训练评论家模型,然后通过 GRPO 进一步提高其预测准确性。根据经验,我们的Critic模型在静态想法评估方面优于 Gemini-3.1-Pro,并且这些收益扩展到智能体推理、持续学习和策略培训。在推理时间演化过程中,他们通过选择更有前途的想法,在相同的验证预算下提高最终解决方案的质量,并从持续学习中获得进一步的收益。在策略训练期间,它们充当学习奖励模型,为不确定的情况保留经验验证,并使用相同的验证资源实现更多的策略更新。总之,这些结果表明,想法级Critic模型可以帮助机器学习Agent在有限的验证预算下发现更好的解决方案并学习更强大的提案策略。
