论文

CISE:不完美代理奖励下的可靠自进化

Reliable Self-Evolution with Imperfect Proxy Rewards

应用与实践科学研究

摘要

基于LLM的自进化搜索是科学发现的有前途方法,但在某些域对每个候选做高保真评估代价过高。此类场景中的自进化系统因此依赖低成本但不完美的代理奖励,可能给不可行候选高分——这些假阳性会污染最终输出与指导后续生成的反馈。这激发了统计校准的奖励区间以实现更可靠的自进化搜索。我们提出共形区间驱动自进化(CISE):用条件共形推断与逐轮在线密度比估计构造候选特定奖励区间;以保守的区间化奖励做进化反馈,仅当所有所需属性区间完全落在各自可行域内才返回候选。在独立性与协变量偏移的显式假设下推导固定轮次覆盖结果。在材料科学三个自进化搜索任务上评估:实验中CISE返回的全部候选在高保真评估下为真阳性,基线返回更多候选但含假阳性。结果凸显当下游验证预算有限时更小更精准候选短名单的价值。代码/项目页:https://github.com/MLAI-Yonsei/CISE.git。