论文
通过图像提示打包进行词元高效的多模态推理
Token-Efficient Multimodal Reasoning via Image Prompt Packaging
摘要
大规模部署大型多模态语言模型受到基于标记的推理成本的限制,但视觉提示策略的性价比行为仍然缺乏表征。我们引入了图像提示打包(IPPg),这是一种将结构化文本直接嵌入到图像中以减少文本标记开销的提示范例,并在五个数据集、三个前沿模型(GPT-4.1、GPT-4o、Claude 3.5 Sonnet)和两个任务系列(VQA 和代码生成)上对其进行基准测试。我们推导出按词元类型分解节省的成本公式,并显示 IPPg 实现了 35.8--91.0% 的推理成本降低。尽管词元压缩高达 96%,但在许多设置中,准确性仍然具有竞争力,尽管结果高度依赖于模型和任务:GPT-4.1 在 CoSQL 上同时实现了准确性和成本收益,而 Claude 3.5 在多个 VQA 基准测试中导致了成本增加。系统错误分析产生了故障模式分类:空间推理、非英语输入和字符敏感操作最容易受到攻击,而模式结构任务受益最多。 125 配置渲染消融揭示了 10--30 个百分点的准确度变化,将视觉编码选择确立为多模式系统设计中的一流变量。