论文

从代码到利用:从自我对弈中提取黑盒优化器

Code-to-Harness: Distilling Black-Box Optimizers from Self-Play

智能体系统Agent Harness

摘要

代理可以通过可执行的练习学习数字搜索策略,然后将该策略转换为文本吗?我们研究低预算的黑盒优化,其中无辅助语言模型仍然远低于强大的经典优化器。在开发过程中,代理会重复编写和评估优化器程序。然后,它将生成的程序和练习记录一次提取到 197 个字的主要 Harness A 中,并在评估之前冻结。在一项独立的 $N=30$ 研究 ($p<.001$) 中,Harness A 将 Gemini Flash 后悔减少了 48\%,进入了练习系列的 GP-BO 表现范围,并降低了所有三个坚持的 BBOB 景观的平均后悔。相同的文本改进了每个测试的 Gemini 执行器并转移到 Claude Sonnet,将遗憾减少了 43\% 和 49\% ($p\leq.005$)。独立的端到端复制产生了 Harness B,即同一性能层上的不同程序和文本。同一框架还在密封的 YouTube 奖励调整生产基准中获得了最低的遗憾。因此,可执行实践是发现搜索策略并将其语言化为部署它的便携式介质的可行方法。