论文

稳定的曲线,不稳定的项目:视频中的项目级缩放异质性 LLM

Stable Curves, Unstable Items: Item-Level Scaling Heterogeneity in Video LLMs

模型评测模型行为与机制分析

摘要

聚合缩放曲线表明,随着视觉预算的增长,视频 LLM 会平稳改善或饱和。我们证明这种观点可以掩盖项目级别的巨大的、相反的变化。我们通过受控视觉预算下的响应轨迹来表示每个冻结模型-项目对,并得出配置互补性、有害过渡和文本覆盖的匹配网格度量。在来自三个架构系列的五个开放视频 LLM、四个多项选择基准分割、开放式 QA 和总结以及固定历史对话生成中,没有一个预算可以满足所有项目。在四模型匹配的 MCQA 网格上,项目级预言机净空跨越 $8.8$-$18.9$ 准确度点,$12.5$-$25.5\%$ 的项目在较低预算下是正确的,但在较高预算下是错误的。适合任务的连续指标显示了超越多重选择的相同互补性:Token-F1 预言机差距在 MLVU 生成上为 $2.7$--$3.7$ 分数,在 AVSD 当前轮生成上为 $3.8$--$4.8$ 分数,即使平均质量随预算而提高。这种影响在帧计数、空间分辨率、采样策略、时空分配、独立执行的原始视频和缓存管道以及每项速率和成员跟踪协议选择方面持续存在。受控抽样干预恢复了 29.0\%$ 的终端回归,结构化框架审计确定了几个重复出现的证据路径。我们发布每个项目的轨迹、协议来源、派生注释和可重复的分析代码作为审计工件。置信级联匹配固定的 $128f$ 准确度,同时将平均共享帧成本降低 $31.7\%$,说明了响应矩阵的一种操作用途。