论文
V-ICAL Bench:评估交互式环境中多模式代理的视频情境学习
V-ICAL Bench: Evaluating Video In-Context Learning for Multimodal Agents in Interactive Environments
摘要
虽然情境学习 (ICL) 使模型能够在不更新参数的情况下适应样本,但多模态 ICL 仍然很大程度上未被充分探索,特别是在交互式环境中的视频演示方面。对于多模式代理来说,从视频中学习提出了独特的挑战:他们必须将上下文演示转化为可执行的策略,将这些策略置于新颖的视觉状态中,并根据环境反馈迭代地完善行动。我们推出了 V-ICAL,这是一种新颖的基准测试,旨在评估多模式代理基于视频的 ICL。 V-ICAL 包含 37 个环境中的 342 个交互任务,利用人工策划的演示视频作为特定任务的行为范例,通过目标初始化的持续交互来评估代理。该基准将上下文知识归纳与核心代理能力无缝连接起来,包括动态环境中的状态基础、时间记忆、规划和适应。对 19 个最先进的多模式代理的广泛评估揭示了显着的局限性:表现最好的模型 Seed-2.1-Pro 的得分仅为 54.4/100,而其他领先模型(例如 Gemini-3.1-Pro、GPT-5.6)未能超过 50,远低于人类基线 83.6。受控比较进一步表明,当前的智能体难以可靠地将视频样本转化为有效的策略,无法产生一致的性能提升。最终,V-ICAL 暴露了多模式药物 ICL 能力的关键差距,强调了未来研究的迫切需要。