论文
AdsCVR:电商跨视频推理基准与主动取证智能体
Beyond Single Videos: Benchmarking and Active Evidence Seeking for E-Commerce Cross-Video Reasoning
摘要
电商视频信息密集,消费者评估商品与商家评估营销策略时常做跨视频比较。但现有多模态模型主要聚焦单视频理解,跨视频比较信息的能力有限。我们提出AdsCVR——首个电商跨视频推理基准:2483个视频、跨六个推理维度的6110个问答对。跨视频推理要求模型在大量冗余帧中定位细粒度证据并整合视觉细节、语音与屏幕文字。为此我们提出AdSeek——在多轮探索中动态选择视觉与音频工具的Agentic 智能体框架,以主动证据获取取代静态均匀采样。为解决强化学习稀疏的信用分配,我们开发离线轨迹修正机制:识别RL生成轨迹中的推理错误与缺失的多模态证据;修正后的轨迹提供监督微调信号,减少RL中学到的偏置。该机制支持修正式自举管道:初始RL暴露推理瓶颈、监督微调纠正、最终RL进一步提升策略。AdSeek在AdsCVR测试集达74.30%准确率,超其Qwen3-VL-8B-Instruct骨干27.90个百分点;并泛化到开放域CrossVid基准,展示有效的主动证据收集。