VisualClaw:物理世界的实时、个性化代理
VisualClaw: A Real-Time, Personalized Agent for the Physical World
摘要
视觉语言模型充当复杂多模式任务的通用接口。然而,部署仍然面临三个差距:VLM 在处理密集视频帧和长提示时通常会产生高延迟和成本,代理支架在部署后保持静态,标准视频 QA 基准测试不会测试代理是否可以在使用工具的工作空间内使用视觉证据。我们推出了 VisualClaw,这是一种围绕两个原则构建的自我进化多模式代理。首先,混合编码通过使用级联门过滤信息量较少的流帧并通过热/冷 top-k 注入压缩文本技能库来降低部署成本。其次,技能进化让智能体从失败中学习:检索到的记忆将进化者作为直接串联的上下文或指导证据,产生有助于未来问题的技能库更新。在使用 2 个 VLM 的 4 个视频 QA 基准测试中,与全帧上传相比,VisualClaw 将每个问题的 API 成本平均降低了 -98%,与离线统一 8 帧基线相比,平均降低了 -25.9%,同时提高了大多数设置中的准确性,例如,在使用 Gemini 3 Flash 的 EgoSchema 上,平均提高了 3.85%,峰值提高了 15.80%。为了解决这一差距,我们策划了 VisualClawArena,这是一个通过严格的五阶段管道构建的 200 个场景的多模式代理基准测试;模型必须在工作空间内使用视频证据、文档、动态更新和可执行检查。在 VisualClawArena 上,与计算机使用代理后端相同的框架将 Codex (GPT-5.5) 的宏观准确性提高了 +2.9%,将 Claude Code (Sonnet 4.6) 的宏观准确性提高了 3.2%(与无进化基线相比),与统一采样基线相比,成本降低了 -9.5%。这些特性使 VisualClaw 非常适合边缘应用程序,其中级联将 1 小时的流会话从约 3,600 个 API 上传减少到仅 5-20 个调用,并且自我进化使其成为完美的个性化助手。