论文

AdaVDR:视频深度研究的自适应工具使用和反思

AdaVDR: Adaptive Tool Use and Reflection for Video Deep Research

智能体系统Agent 工具调用

摘要

视频深度研究通过共同理解视频内容并从开放网络中检索外部知识来回答复杂的问题。然而,不同的问题和视频需要不同的工具使用策略,不恰当的工具调用可能会产生不正确的结果。不确定的基础和检索也会使不必要的交互成本高昂且容易出错,从而增加延迟和推理错误。为了应对这些挑战,我们提出了 AdaVDR,一种具有自适应工具调用和反射功能的自适应视频深度研究代理。 AdaVDR 根据任务及其功能选择工具,仅在不可靠的中间结果需要纠正时回溯。为了实现这些功能,我们开发了视频深度研究数据构建管道。我们首先在不同视频中发现与检索相关的事件和实体,并通过基础和外部检索获取详细信息,以构建高质量的问答对。对于每个 QA,特定于任务的提示将信息获取过程组织成工具使用轨迹,允许不同的问题和视频类型遵循不同的基础和检索策略。我们进一步引入了模型条件工具必要性过滤,它根据目标模型的视频理解和内部知识评估工具调用,删除模型可以绕过的工具或工具链。这会产生适合目标模型的视频理解能力和知识的轨迹。使用此管道,我们构建训练数据和 VDR-EE,这是一个涵盖以实体为中心和以事件为中心的问题的基准。我们执行有监督的 微调,然后进行具有冗余感知奖励的强化学习,以加强自适应工具调用和反射。实验表明,我们的方法在 VDR-EE 上评估的开源模型中表现最好,并且比 VideoDR 上的基本模型有了显着改进。