论文

OpenJarvis:个人设备上的个人人工智能

OpenJarvis: Personal AI, On Personal Devices

模型优化端侧模型

摘要

OpenClaw 和 Hermes Agent 等个人人工智能堆栈正在成为日常工作的核心,但它们几乎将每个查询(通常针对敏感的本地数据)路由到云托管的前沿模型。用现有堆栈中的本地模型替换前沿模型是行不通的:将 Claude Opus 4.6 替换为 Qwen3.5-9B 会使 PinchBench 和 GAIA 等个人 AI 任务的准确度下降 25-39 个百分点。现有堆栈围绕特定云模型捆绑代理提示、工具描述、内存配置和运行时设置。只能调整提示,并且最先进的提示优化器可以自行缩小本地云差距的 5 个百分点。这催生了一种分解的个人人工智能堆栈:它公开了可以单独或联合优化的各个原语,以缩小本地云差距。我们提出了 OpenJarvis,一种架构,它将个人 AI 系统表示为包含五个原语的类型化规范:智能、引擎、代理、工具和内存以及学习。每个原语都是一个独立的可编辑字段,使堆栈可以根据准确性、成本和延迟进行端到端优化和测量。为了在不放弃本地模型属性的情况下缩小本地云差距,OpenJarvis 引入了 LLM 引导的规范搜索,这是一种本地云协作,其中前沿云模型建议在搜索时跨规范进行编辑,只接受非回归编辑,并且生成的规范在推理时完全在设备上运行。通过 LLM 引导的规格搜索,设备上的规格在 8 个基准测试中的 4 个上匹配或超过云准确度,并且平均与最佳云基准相差 3.2 个百分点以内。它们还将边际 API 成本降低了约 800 倍,并将端到端延迟降低了 4 倍。