论文

ART:通过优化视觉输入适配冻结多模态大语言模型

Fine-tuning Multi-modal LLMs with ART: Art-based Reinforcement Training

模型训练参数高效训练

摘要

LoRA与软提示是两类参数高效微调方法,前者增加权重,后者在输入中增加任务专用软词元,但均需调整预编译、预优化模型的计算图,在vLLM等高吞吐引擎中未获完整支持。ART(Art-based Reinforcement Training)仅优化冻结多模态大语言模型的原始视觉输入,将信息注入模型,在预编译计算图上实现软词元式适配。梯度直接反向传播到像素数组,因此支持不同微调目标,优化结果还可风格化为任务相关计算图案。研究在多个尺寸的开放Qwen模型和文本基准上验证方法,在数学及结构化工具使用任务上达到与LoRA相近的准确率。