论文

RSI跨能力递归自提升

Recursive Self-Improvement in Unified Multimodal Models

模型训练合成数据

摘要

统一多模态模型(UMM)同时理解与生成文本和图像,这使模型能生产自己的训练数据。现有UMM自提升把监督留在视觉侧,由图像理解评判图像生成。我们提出递归跨能力自提升(RSI),一个UMM的文本与视觉能力互供训练数据的训练循环。每轮中,模型生成图像并读图找出不足,然后编写针对这些不足的程序,由执行对照规格验证每个结果。已验证的渲染用于训练图像生成,带标注的渲染与模型自己的正确程序用于训练视觉理解与程序编写。程序执行因此充当模型之外的真相来源,使误差不在轮间累积。我们在图表上研究RSI并构建BasicChartBench评估早期训练的开放模型。在与训练措辞不同的请求上,四轮RSI把分数从45.7%提升到60.2%,而继续训练停在46.3%。已验证构建承载大部分增益,针对模型失败的定向再加3.5%。期间已验证程序占比从48.9%升至95.2%,读图器在编辑渲染上的准确率从55.6%升至87.4%。