论文

案例:高效长视频的成本感知停止智能体

CASE: Cost-Aware Stopping for Efficient Long-Video Agents

模型推理测试时计算扩展

摘要

长视频智能体可以主动收集与问题相关的证据,但它们通常会隐含一个核心决策:智能体什么时候看到足够多的内容来回答?我们提出了 CASE,一个插件终止框架,将这个决策框架为策略条件顺序停止。在每个因果检查点中,CASE 都会将累积证据的辅助多项选择评估与主机智能体的执行状态相结合。从完整的本地轨迹中,我们构建了一个成本感知目标,将现在回答与稍后停止沿着相同的搜索路径进行比较,共同考虑答案的正确性和继续推理的全部成本。轻量级岭回归器学习此决策间隙并生成停止/继续决策。我们使用 VideoSeek 和 AVP 评估三种视觉语言模型。在 Video-MME 上,端到端准确度平均变化 +0.67 个百分点,而 CASE 将模型token的使用量减少了 53.63%。同样冻结的策略然后将零样本传输到 LongVideoBench 和 MLVU,端到端的准确度变化分别为 +3.38 和 +4.58 点,同时分别比模型token节省 58.78% 和 51.28%。在所有智能体模型基准组合中,CASE 在所选操作点的比较停止方法中获得了最高的精度效率帕累托前沿覆盖率 (83.3%)。在线执行保留了这种有利的准确性-效率权衡,并且另外将测量的运行时间平均减少了 54.1%。 CASE为长视频推理智能体提供了一个插件终止框架,使他们能够决定何时不再值得进一步获取证据。

案例:高效长视频的成本感知停止智能体的原论文方法或结果图
图 2:CASE 概述。主持人选择从哪里获取证据; CASE 使用 STOP/CONTINUE 控制和约束前缀完成来包装本机搜索循环。完整的本地轨迹监督答案质量和异构延续成本。