论文

思想流重要吗?评估用于视频场景理解的 Gemini 视觉语言模型的推理

Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding

模型评测评测方法与指标

摘要

我们对内部推理痕迹(我们称之为思维流)如何影响视觉语言模型中的视频场景理解进行了基准测试。在从 100 小时视频中提取的场景中使用 Google Gemini 2.5 Flash 和 Flash Lite 的四种配置,我们提出三个问题:更多的思考是否会带来更好的输出,收益在哪里停止,以及这些模型实际上考虑了什么?我们引入三个评估指标。内容性衡量的是思想流中有多少是有用的场景内容与元评论。思想最终覆盖率衡量思想流转化为最终输出的忠实程度。主导实体分析可识别模型关注的主题、操作和设置。 GPT-5 担任独立法官。我们发现,通过额外的思维平台,质量会很快提高,其中大部分改进发生在前几百个标记中。 Flash Lite 在质量和词元使用之间提供了最佳平衡。紧张的推理预算会导致模型在最终输出中添加它从未推理过的内容,这是一种压缩步骤幻觉的形式。尽管属于不同的模型层,Flash 和 Flash Lite 却产生相似的思想流,尽管它们的风格不同:Flash 讨论其推理过程,而 Lite 则侧重于描述场景。