论文

CARE:具有可执行评分程序的情境感知排名演化,用于优化预算反应

CARE: Context-Aware Ranking Evolution with Executable Scoring Programs for Budgeted Reaction Optimization

智能体系统Agent 架构与控制循环

摘要

高通量实验可以评估许多反应条件,但组合条件空间仍然超出可用的实验预算。这使得实验选择成为一个顺序决策问题:在知道其结果之前,必须从有限的观察中选择每个新条件。 LLM可以表达特定于任务的选择逻辑。然而,直接建议既不是可以验证和修改的持久可执行对象,也不是独立可审计的决策规则。我们引入了 CARE,一种参考条件控制器,它将程序合成与实验选择分开。 LLM 编写一个可执行评分程序,对其余条件进行排名,而非 LLM 参考策略则提供数字候选和支持摘要。 CARE 从程序中形成一个可选的替代方案,应用参考条件干预门将其与参考进行比较,并在显示所选结果之前记录决策。每个新结果都会更新控制器状态,并可以触发活动程序的保留、修订或重新生成。这种以结果为导向的程序演变改变了评分逻辑,而无需更新 LLM 参数。在 8 个反应优化任务中使用 30 个种子进行匹配的离线重放中,CARE 在评估的方法中获得了最低的归一化遗憾、最高的归一化最佳 AUC 以及最高的 Top-1% Success@15。这些结果支持使用由 LLM 编写的评分程序作为参考条件优化器的一个组件,而不是作为独立的实验选择器。