论文

VideoHarness-RSI:基于冻结视觉-语言模型的长视频理解递归Harness自改进

VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models

智能体系统上下文与知识上下文工程Agent Harness智能体自我改进递归自我改进(RSI)

摘要

长视频理解的关键在于如何用有限的模型上下文从长得多的视频中构建输入。现有方法通过压缩、检索、记忆和智能体式证据获取来改进这一过程,但这些机制通常作为人工设计的推理系统的一部分引入,或与其他组件一起优化。这使得一个更简单的问题难以被单独考察:仅改进可执行的上下文构建程序本身能带来多少收益?我们通过VIDEOHARNESS-RSI研究这一问题,它是一个围绕冻结视觉-语言模型(VLM)递归搜索可执行上下文构建器的受控基线。外环提议者利用既往程序、评测结果和执行轨迹生成候选harness,这些候选被端到端执行和评测,成功的变体被保留用于进一步搜索。这使长视频理解成为自动化harness设计的一个受控实例:可搜索的对象是可执行的程序结构,而回答模型和接口保持固定。从均匀采样出发,递归harness搜索持续找到改进空间并超越若干较弱的人工基线;而从更强的人工基线出发,同样的RSI过程带来进一步提升。选出的harness无需进一步搜索即可迁移到其他长视频基准。这些结果共同确立可执行上下文构建为一个独立的优化层,并为研究冻结VLM周围的harness发现与迁移提供了可复现基线。

VideoHarness-RSI:基于冻结视觉-语言模型的长视频理解递归Harness自改进:论文配图
图1:受控harness搜索设置概览。外循环修改可执行的上下文构建代码;内层VLM及其最终上下文接口保持固定。开发数据提供搜索反馈,此后所选harness被冻结,用于保留问题与跨基准评估。