论文

ELMER:探索和完善的进化语言模型

ELMER: Evolutionary Language Model that Explores and Refines

模型训练偏好优化

摘要

程序进化可以衡量突变是否有帮助,但它很少控制突变在行为空间中移动的距离。语法编辑大小是一个不可靠的代理:小的代码更改可以改变几乎每个操作,而较大的重写可以保留相同的执行跟踪。我们引入了一种进化语言模型,它可以搜索自然语言策略描述并编译类型化程序以供​​执行。完全微调的 Qwen3-8B 模型可学习三种任务条件操作:条件语义突变、自然语言到特定领域语言 (GPTL) 编译以及 GPTL 到自然语言翻译。使用直接偏好优化 (oDPO),根据突变强度(低、中、高)的条件输入对该模型进行微调。在 252 个固定预算进化搜索中,oDPO 提高了行为校准和有限预算搜索效率。自然语言达到了观察到的最高的坚持适应性。我们的分析表明,条件输入(突变强度)系统地改变了语义编辑组成,并且语言突变在匹配的小到中等行为位移下保留了更多的父母适应性。这些结果表明,语言可以作为可执行程序空间上可操纵的、基于执行的搜索表示。