论文

WMLLM:通过“预测然后行动”世界建模实现自我进化优化代理

WMLLM: Self-Evolving Optimization Agents via Predict-Then-Act World Modeling

智能体系统Agent 架构与控制循环

摘要

由于搜索空间庞大、结构弱且高维,黑盒优化问题仍然具有挑战性。现有方法常常面临样本效率低下的问题,因为它们依赖于直接候选生成或试错细化。提高搜索效率的一种自然方法是使用世界建模,这可以帮助在进行昂贵的评估之前确定有希望的优化方向。由于这些候选人的隐性知识,大语言模型 可以非常准确地预测他们的结果。受这一观察的启发,我们提出了 WMLLM,一种基于预测然后行动世界建模的自我进化优化代理框架。代理首先预测有希望的方向,然后采取行动生成候选方向。结合代理多轮细化、基于群体的搜索和强化学习,WMLLM 细化了其隐式世界模型及其在搜索过程中的优化策略。黑盒优化任务,特别是多目标分子优化的实验表明,WMLLM 提高了样本效率和最终优化性能。在多目标分子优化基准上,WMLLM 在有限的评估预算下取得了最先进的结果。