论文
Janus:昂贵评估预算下LLM驱动发现的算法-评估器协同进化框架
Janus: An Algorithm-Evaluator Co-Evolution Framework for LLM-Driven Discovery under Expensive Evaluation Budgets
摘要
LLM驱动的程序发现依赖快速评估器反馈,但许多科学与工程任务需要高保真仿真、硬件执行或物理实验,使每次评估都很昂贵。廉价的代理评估器可降低这一成本,但固定的代理容易受搜索引起的分布偏移影响,且难以从稀疏、带搜索偏置的标签可靠拟合。我们提出Janus,一个用LLM协同进化目标程序与可执行代理评估器的框架。为解决标签稀缺,Janus利用LLM中编码的领域知识生成任务专用评估器程序,并用真实结果校准它们。为缓解分布偏移,Janus随目标程序一起进化评估器,用与晋升对齐的目标选择评估器,并维护带在线信用更新的区域条件化评估器组合。由于代理预测仍可能出错,Janus仅用其排序候选,并要求真实验证后候选才能进入目标程序种群或更新当前最优。在五个科学与工程设计任务上,Janus在真实评估预算内取得更大的最优改善曲线下面积和更高的最终性能,优于仅进化目标程序的匹配基线。平均而言,Janus以少59.1%的真实评估达到基线最终改善的99%。进化后的代理评估器排序有前景的候选也比其种子版本更准确。综合而言,这些结果将评估器引导的LLM发现从拥有廉价可扩展反馈的任务扩展到可信评估稀缺且昂贵的科学领域。
