论文
Agentic Monte Carlo:模拟黑盒代理的强化学习
Agentic Monte Carlo: Simulating Reinforcement Learning for Black-Box Agents
摘要
LLM 智能体以两种不同的方式运行:适合强化学习(RL)的开放权重智能体和其行为必须纯粹在测试时控制的黑盒智能体。尽管黑盒代理通常由最先进的专有 LLM 支持,但仅 API 访问无法进行参数级优化,从而导致大多数 RL 方法不适用。为了解决这个限制,我们转向强化学习和贝叶斯推理之间已知的等价关系。我们提出 Agentic Monte Carlo (AMC) 直接从黑盒代理的最优策略中采样,而不是通过 RL 对其进行训练。最优策略是轨迹的后验,我们将其先验定义为固定黑盒 LLM 代理。我们使用顺序蒙特卡罗通过学习值函数来引导代理,同时保持底层黑盒模型不变,从而从后验中进行采样。我们在 AgentGym 基准测试的三个不同环境中验证了 AMC,在我们扩展方法的测试时间计算时,展示了相对于提示基线的显着改进,甚至超越了组相对策略优化 (GRPO)。 AMC 展示了对黑盒 LLM 代理执行原则性 RL 式优化的可行性。代码可在 https://github.com/layer6ai-labs/Agentic-Monte-Carlo 获取