论文
InternVideo3:通过多模态上下文推理赋予基础模型智能体能力
InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning
摘要
基础模型的最新进展已转向涉及多步骤推理和工具使用的代理行为。然而,开源工作主要集中在以文本为主的设置上,而长期多模式任务尚未得到充分探索。这种差距在需要持续时间理解和迭代交互的视频任务中很明显。我们提出了 InternVideo3,这是一个通过多模态上下文推理 (MCR) 增强这些功能的框架。 MCR 将理解视为一个共享的、不断发展的上下文中的闭环过程,其中包含观察、指令、推理、工具操作和记忆。这将长视频理解定义为证据积累和验证。为了确保效率,我们引入了多模态多头潜在注意(M^2LA),一种保留词元的重新参数化,压缩 KV 缓存状态,同时保留完整的词元流。我们的分阶段训练包括持续预训练、短到长监督 微调、基于规则的强化学习和 同策略 蒸馏。实验表明,InternVideo3 在 Video-MME、MLVU 和 EgoSchema 等基准测试中实现了强大的性能。我们进一步将该模型实例化为具有检索工具的视频代理,展示了强大的基于证据的行为。我们的结果表明,高效的上下文处理和闭环推理对于将开放多模态模型调整为长期视觉基础的代理至关重要。