论文
Video-RSI:通过 Harness Evolution 实现视频理解Agent的递归自我改进
Video-RSI: Recursive Self-Improvement of Video Understanding Agents via Harness Evolution
摘要
视频理解Agent通过可执行的工具获取证据,该工具控制他们观察到的内容以及如何使用这些观察结果。然而,执行痕迹仅包含当前工具获取的证据,导致对失败的相互竞争的解释尚未解决,并限制了自我改进的基础。我们引入了 Video-RSI,这是一个递归自我改进的框架,其中视频理解Agent使用自己的语言模型来修改其工具。通过主动视频调查,该模型重新审视原始训练视频,通过额外的观察结果来测试相互竞争的故障解释,将证据中提出的变化建立在现有痕迹之外。成本感知Harness演变将这些诊断转化为可重复使用的修订,并通过考虑答案准确性和视觉成本来确定保留哪些修订。在我们对视频理解基准的评估设置中,进化后的Agent在处理更少的帧的同时提高了准确性,并实现了与现有视频理解Agent相比具有竞争力的准确性-效率权衡。这些结果证明了视频理解Agent通过利用进化来改善其自身证据获取和使用的潜力。代码可在 https://github.com/bingjunluo/Video-RSI 获取。