论文

多模态乘法 LLM:文本、图像和音频输入的计算

Multiplication in Multimodal LLMs: Computation with Text, Image, and Audio Inputs

模型评测基准与评测资源

摘要

多模态 LLM 可以准确地感知跨模态的数字内容,但当相同的底层算术问题以数字、数字词、图像或音频形式呈现时,无法执行精确的多位数乘法。由于现有的基准通常缺乏跨模式的系统配对实例,因此仍然很难比较模型系列内部和模型系列之间的真实算术限制。因此,我们引入了一种受控的多模态乘法基准,它通过来自可再现生成器的配对实例来阶乘地改变数字长度、数字稀疏性、表示(例如,数字与数字词)和模态(文本、渲染图像、音频)。我们还将算术负载 C 定义为总数字计数和非零数字计数的乘积,作为操作计数的紧凑的、机械驱动的代理。在各种评估中,随着 C 的增长,准确性急剧下降,通常在 C > 100 时接近于零。事实上,C 仍然可以预测各种模式和模型的性能,R 平方通常 > 0.5,接近更复杂的算术负载测量值(计算中间算术步骤的数量)。单独的感知与计算分解表明,多模态退化主要是计算性的,而不是感知性的:在匹配感知检查中,即使乘法精度下降,模型在各模态中也接近完美(> 99%)。除了测量模型何时失败之外,我们还询问它们倾向于遵循哪些程序。我们引入了一种强制完成损失探针,可以对启发式特定推理前缀进行评分——包括列乘法、分配分解和舍入/补偿。在这里,分解在文本和视觉模式中都受到青睐;启发式特定 LoRA 适配器会产生近乎正交的更新,但会降低准确性,这表明基本模型维护了一个经过良好调整的内部路由器。