论文
暂停和思考:基于视频的辅助行动建议的数据集和基准
Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion
摘要
最近的视觉语言模型(VLM)在视频中的基础推理、时间一致性和上下文感知规划方面遇到了困难。我们引入了“pause-and-think-T”,这是一个以推理为中心的训练数据集,它鼓励模型暂停,对视觉证据进行推理,并产生简洁、可操作的响应。该数据集在生成答案之前促进结构化推理,指导模型实现类人的、基于场景的协助。我们微调紧凑的 4B 参数模型,并根据针对上下文理解和目标规划任务的暂停思考 B 基准对其进行评估。该模型在比 Qwen3-VL-235B (58.9%) 少 59 倍的参数下实现了 58.0% 的准确率,在场景理解方面与 GPT-5.2 相当,并超越了 GPT-4o。除了我们的基准之外,它还在 EgoThink 和 TempCompass 上显示出强大的分布外性能,在功能可见性、辅助、归因识别、情境推理和时间顺序方面取得了显着的进步,而无需进行特定于基准的训练。我们的结果表明,有针对性的推理监督使紧凑的模型能够提供可操作的、基于视觉的指导,同时泛化到训练数据之外,而不需要大规模的模型扩展。