论文

大语言模型作为带约束双目标凸优化的摊销Pareto前沿生成器

Large Language Models as Amortized Pareto-Front Generators for Constrained Bi-Objective Convex Optimization

模型训练监督微调与指令调优

摘要

为带约束的双目标连续优化生成可行Pareto前沿是多准则决策的核心。现有方法通常依赖迭代标量化、进化搜索或问题专用求解器,需要对每个实例反复优化。我们提出DIPS,一个端到端框架,将大语言模型微调为带约束双目标凸优化的摊销Pareto前沿生成器。给定文本形式的问题描述,DIPS直接输出一组有序的可行连续决策向量来逼近Pareto前沿。为使连续优化与自回归语言建模兼容,DIPS结合了紧凑离散化方案、为新数值token设计的Numerically Grounded Token Initialization,以及Three-Phase Curriculum Optimization,后者逐步对齐结构有效性、可行性与Pareto前沿质量。在五族带约束双目标凸问题上,微调后的7B参数模型相对参考前沿取得95.29%到98.18%的归一化超体积比。借助vLLM加速推理,DIPS最快0.16秒求解一个实例,并在所评估设置下优于通用与推理型LLM基线。这些结果表明,LLM可以充当连续Pareto前沿逼近的有效摊销生成器。

大语言模型作为带约束双目标凸优化的摊销Pareto前沿生成器:论文配图
图 1:DIPS 框架概述。连续帕累托前沿目标通过离散化方案转换为紧凑的二标记序列;新添加的数字标记通过数字接地标记初始化(NGTI)进行热启动;然后,适应 LoRA 的LLM将在三阶段课程优化 (TPCO) 目标下接受训练;在推理时,多个解码通道通过多通道帕累托融合(MPPF)合并到最终边界中。