论文
通过成本校准的 Frontier Utility 进行预算感知 LLM 发现
Budget-Aware LLM Discovery via Cost-Calibrated Frontier Utility
摘要
大语言模型 通过对评估的候选者进行推理时搜索,越来越多地支持科学和算法发现。现有的自适应发现控制器仅根据分数进度分配信用,即使提示长度、重试和指导调用会导致搜索操作产生不同的词元成本。在固定的搜索预算下,控制器必须在预算耗尽之前决定开发哪个前沿以及其收益是否合理于已实现的成本。我们证明,在最坏的情况下,随着前沿数量和成本异质性的增长,成本盲目控制可能会丧失可达到的质量,几乎消失殆尽。为了解决这个限制,我们引入了 \textbf{CostAda},一个基于 \emph{成本校准前沿效用} 构建的自适应控制器。通过评估相对于已实现行动成本的进展并根据剩余预算调整信用额度,CostAda 协调当地勘探强度、前沿分配和预算策略干预。因此,已实现的行动成本和剩余预算决定了搜索,而不仅仅是充当会计变量或停止规则。在 GLM-5 和 GPT-5.4 的八个基准测试中,CostAda 在 16 个基准骨干对中的 13 个基准骨干对上以至多一半的预算达到了最强基准的全预算质量,并在所有 16 个对上实现了最强的最终质量。