论文
AgentHPOBench:评估LLM Agent作为序贯超参数优化器的基准
AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers
摘要
随着LLMs从代码生成系统转变为自主的科学研究代理,评估其实验能力变得越来越重要。现有的基准测试通常侧重于静态代码生成、论文复制或最终答案的正确性,但不直接评估代理能否解读实验证据并据此指导后续超参数决策。为解决这一差距,我们引入了AgentHPOBench,这是一个包含30个可执行的机器学习任务的序列基准,覆盖七个研究领域。每个任务都从经过验证的基准运行开始,之后代理进行一系列干预。在每个步骤中,代理观察到累积的配置、指标和日志,然后提出下一个有效的配置。我们评估了12种广泛使用的代理和传统的HPO基准,采用统一的协议进行评价。结果表明,当前的代理在不同领域表现出可测量的实验优化能力,但仍然面临持续迭代优化、复杂日志诊断和一致向报告参考性能的进展等方面的明显限制。