论文

Readiness Gating:视频模型何时已有足够证据?

Have I Seen Enough? Frozen Video-Language Models Encode Evidence Readiness

模型推理解码与生成控制

摘要

流式视频语言模型既要决定回答什么,也要判断当前问题的证据是否已到达。已有系统训练独立触发器;我们问未修改模型是否已计算这一信号。冻结VideoLLM包含可线性读取的证据就绪信号,标签来自带时间戳证据而非模型输出。在字节完全相同的共享评测中,七模型都可解码;最严格未就绪采样下AUROC为0.733—0.905,拟合时钟近随机。训练探针时未使用某基准族任何视频,仍能读取该族。信号以问题为条件:相同窗口只改问题,66.1%配对读出反转,问题盲对照按构造处于随机。答错时仍可编码就绪,错误答案AUROC为0.722。在匹配延迟的回答选择中,就绪优于不确定性估计器及其监督组合,更贴近独立人工判断。已有流式触发器虽也是线性读出,但在自身底座激活上与就绪近乎正交,解码明显弱于探针。Readiness Gating以该信号控制回答时机,在相同视频时长下准确率最多提高9.75个百分点,计算开销可忽略。26配置中,收益随任务可用准确率提升空间变化;保持像素相同但改变提升空间的干预,也相应改变收益。

Readiness Gating:视频模型何时已有足够证据?:论文原图
图 1:模型可以同时充满信心和尚未准备好。在物体进入流之前询问其颜色时,模型仅根据先前的信息就可以自信地回答;其冻结残余流的线性 读出 报告证据尚未到达。 (原理图;在第 4 节中测量。)