论文

超越脚本搜索:通过 Agentic 黑盒优化进行样本高效的奖励发现

Beyond Scripted Search: Sample-Efficient Reward Discovery via Agentic Black-box Optimization

智能体系统模型训练强化学习Agent 规划Agent HarnessAgentic RL

摘要

为低级强化学习(RL)控制设计密集奖励函数仍然很困难。最近的工作使用大语言模型 (LLM),利用脚本搜索算法中的策略训练反馈来迭代生成和完善奖励函数。然而,评估每个候选者需要进行完整的强化学习训练,这使得样本效率成为复杂控制任务奖励搜索的核心挑战。为了解决这个限制,我们提出了一个 Agentic 奖励黑盒优化 (ARBO) 框架,其中 LLM Agent在运行时根据作为其持久工作空间维护的评估历史记录构建搜索策略。评估历史由两部分组成:评估预言机维护的观察结果,包括候选分数、每学期训练曲线和错误回溯;以及Agent维护的信念,记录诊断和预期的后续步骤。Agent使用工具进行查询并生成下一批奖励候选者,而不是根据固定提示一次性生成它们。在共享评估预算下,在四个控制域中,ARBO 的操纵成功率比基线平均值提高了 29.9%,电网得分提高了 192.8%。消融检查每个组件的贡献和对主干选择的敏感性。