论文

用于端到端组合优化的 VLM 微调

VLM Fine-Tuning for End-to-End Combinatorial Optimization

应用与实践结构化分析、预测与决策

摘要

大语言模型 (LLM) 为端到端组合优化 (CO) 提供了统一的接口,但单独的文本序列化可能会掩盖对于生成有效的 CO 解决方案非常重要的空间和关系结构。本文提出了一种通用视觉语言求解器,它通过输入衍生的视觉表示来增强文本实例描述。单一视觉语言模型 (VLM) 应用于不同的 CO 任务,并使用监督微调和验证者引导的强化学习进行训练。虽然视觉输入不包含黄金解决方案或解决方案衍生的信息,但我们的实验表明,与纯文本对应物相比,VLM 通常提高了解决方案质量,尤其是在处理 CVRP 和 JSSP 等更复杂的 CO 问题时,效果尤其明显。视觉信息的优势在大问题规模上更加明显。