论文

支付太多词元?具有简单启发式的有效且经济高效的多模态 LLM 注释

Paying for Too Many Tokens? Valid and Cost-Efficient Multimodal LLM Annotation with Simple Heuristics

模型评测评测方法与指标

摘要

视觉语言模型 (VLM) 可以大规模进行视频注释,但成本会迅速累积:以每秒一帧的速度处理典型的 60 秒短视频需要数百万个词元。为了降低成本,研究人员依靠启发式方法,例如对帧子集进行采样、将视频压缩到图像网格中或仅使用单一模态。然而,目前尚不清楚哪些启发式方法可以节省成本,以及它们是否保留了这些注释所得出的下游结论。为了解决这一差距,我们使用短片视频对情感和主题分类这两个计算社会科学 (CSS) 任务对这些启发式方法进行了系统评估。我们沿着文献通常分别处理的三个轴评估每个配置:分类准确性、下游推理的有效性和每个视频词元成本。首先,我们发现准确性和有效性存在分歧:最高精度的配置可能会产生错误的结论。其次,模态价值得不到保证:仅文本就可以产生强大的性能,这表明添加模态可能会在不增加信号的情况下增加成本。最后,我们发现在注释短视频时,成本可以与视频长度解耦:通过简单的镜头转换检测构建的单个 $2\times8$ 图像网格接近全视频理解($κ$差距约在0.05以内),词元成本为 $\sim 15\%$。基于这些发现,我们得出了可以在 CSS 中启用成本感知 VLM 注释的指南。