论文
在线代理修复:将高保真反馈与闭环发现中的搜索长度解耦
Online Surrogate Repair: Decoupling High-Fidelity Feedback from Search Length in Closed-Loop Discovery
摘要
闭环人工智能科学家可以以较低的边际计算成本生成候选设计,而可靠的反馈可能需要湿实验室合成、表征或高保真计算。通过定制实验室自动化解决这种不平衡问题仍然需要大量基础设施且成本高昂,而用固定替代物替换新实验会留下持续的模型错误,这些错误可能会通过优化而放大。我们提出\emph{在线代理修复}(OSR),这是一种闭环算法,它使用稀疏的高保真评估来在主要使用廉价代理反馈进行的较长代理搜索中更新代理。获取规则选择代理累积的提案中的哪些设计接受高保真度评估,并且生成的标签更新后续剧集中使用的替代方案。在受控合成环境中,我们证明改善全局代理拟合并不一定会减少最大遗憾,而 Q90-UCB 和预期改进 (EI) 通过将评估引导到决定优化器决策的区域来显着减少遗憾。在 MADE 上,每集后接收高保真反馈的控件需要多 $6.36$--$7.23\times$ 的 oracle 查询来匹配两个 LLM 协调器下的 Online EI,以及在非 LLM Chemeleon+MLIP 工作流程下多 $10.27\times$ 的 Oracle 查询。在线代理修复在固定代理操作和每集后的高保真反馈之间引入了一种新颖的第三反馈机制,将高保真评估的频率与代理搜索的持续时间分开。