论文

从AI助手到AI科学家:使用LLM代理自主发现LLM-RL算法

From AI Assistant to AI Scientist: Autonomous Discovery of LLM-RL Algorithms with LLM Agents

应用与实践科学研究

摘要

发现语言模型的改进策略优化算法仍然是一个成本高昂的手动过程,需要重复的机制级修改和验证。与简单的组合代码搜索不同,这个问题需要搜索与训练动态紧密结合的算法机制,同时在迭代中重用经验证据。我们提出了 POISE,一个用于自动发现语言模型策略优化算法的闭环框架。 POISE 维护一个结构化的、有谱系链接的档案,链接提案、可执行的实现、标准化评估和自然语言反思,以支持证据驱动的迭代。在从 GRPO 开始的数学推理实验中,POISE 评估了 64 种候选算法并发现了改进的机制,包括分析方差缩放和有效性屏蔽。最佳变体将加权总体从 47.8 提高到 52.5 (+4.6),并将 AIME25 pass@32 从 26.7% 提高到 43.3%,证明了自动策略优化发现同时支持可解释设计原则的可行性。