论文
贪心是强默认:作为迭代优化器的智能体
Greedy Is a Strong Default: Agents as Iterative Optimizers
摘要
经典优化算法——爬山法、模拟退火、基于种群的方法——通过随机扰动生成候选解。我们用一个 LLM 智能体替换随机提议生成器,它对评估诊断信息进行推理以提出有依据的候选,并追问:当提议者不再随机时,经典优化机制是否仍有帮助?我们在覆盖离散、混合与连续搜索空间的四个任务上进行评估(全部在 3 次独立运行中重复):Breast Cancer 上的规则式分类(测试准确率从 86.0% 到 96.5%)、STL-10 上 MobileNetV3-Small 的混合超参数优化(从 84.5% 到 85.8%,灾难性失败为 0 次,而随机搜索为 60%)、SST-2 上 Qwen2.5-0.5B 的 LoRA 微调(从 89.5% 到 92.7%,以 2 倍效率追平 Optuna TPE),以及 Adult Census 上的 XGBoost(AUC 从 0.9297 到 0.9317,以少 3 倍的评估次数与 CMA-ES 打平)。实证上,在这些任务中:跨任务消融表明,模拟退火、并行调查者乃至第二个 LLM 模型(OpenAI Codex)相比贪心爬山法均无收益,却需要 2-3 倍的评估次数。在我们的设定中,LLM 学到的先验似乎足够强,以致接受规则的精巧化影响有限——仅第 1 轮就带来大部分改进,且各策略下的变体收敛到相似的配置。其实践含义出人意料地简单:带早停的贪心爬山法是一个强默认选择。除准确率之外,该框架还产出人类可解释的产物——所发现的癌症分类规则独立复现了既有的细胞病理学原理。
