论文
FORESIGHT:流式VLM不重训的未来感知规划
Foresight: planning future perception in streaming VLMs without retraining
摘要
既有流式视觉语言模型(VLM)在视觉流上持续感知与推理,但其计算通路在推理全程固定——无法使计算适配演化的场景动态,而不同未来事件需要不同水平与形式的感知。我们证明流式VLM固有具备预期近期未来的能力,并利用该能力以训练自由方式动态配置未来计算。实现这种前瞻计算非常具有挑战:未来预期须足够可靠以引导计算、规划须与流式推理并行、在线重配须开销可忽略。为此我们提出FORESIGHT——由共享权重、输入编码器与KV缓存的两个孪生LLM构成的双流架构:第一个LLM持续处理进入token,第二个跑在流之前以预期未来上下文、规划未来计算并生成任务响应而不打断流式推理。每份计划决定下一步何时推理、届时检查什么、采样多密,把瞬态证据与持久控制分开。所得计算计划经带模式引导解码与轻量diff更新的高效重配协议在线执行,以低开销实现动态适配。以冻结Qwen3-VL-8B骨干,FORESIGHT在OmniPro Online评估达23.0平均联合F1、领先最强训练基线9.5%,同时使骨干在StreamingBench提升6.7、OVO-Bench提升15.4——证据越晚出现在视频流中增益越大(最大18.7)。