小红书基于OpenClaw构建企业级个人助理
概述
年初 OpenClaw 爆火后,小红书以 3 人小组启动企业级 AI 个人助理建设:2 月 11 日做出决策,3 人小组用 3 天推出内测版本;3 月 9 日一周完成架构升级加固,开放 2000 个公测名额;3 月 17 日两周完成规模化提拉,实现全员覆盖,从决定做到全员覆盖约一个月。技术选型上,团队选择基于 OpenClaw 而非完全自研,理由是产品成熟度(已大规模生产验证、工具链完备)、极速交付(3 人 3 天)、架构可控(开源透明可做深度定制,后续安全加固、成本优化、Memory 增强均在其上自主演进)与生态优势(Skill Hub 可共建),核心判断标准是 Time to Value。运作机制采用 AI Native 方式:先定义新模式、快速推 MVP 验证、验证通过立即规模化,先让用户用起来收集反馈再迭代。内测上线后效果超预期——运营用它写方案、算法用它看数据、HR 用它筛简历、财务用它搭建财务工具平台,反馈坚定了推全员的信心。该系统对全公司员工可用(含非研发岗位),不以外部客户为服务对象。 从「好玩的 demo」到全员使用的企业级产品,安全是第一座山:代码要在沙箱里执行、用户敏感数据会流经模型、系统需与生产环境隔离,否则 IT 与安全团队不会放行。团队搭建名为 Seal AI Zone 的专属隔离集群,运行在独立 K8S 集群并与生产环境完全隔开,所有员工通过 Seal 客户端接入;集群内有完整安全策略管控、专属 LLM 服务、独立存储,以及与公司 SSO / LDAP / VPN 打通的身份认证体系,Agent 执行代码的沙箱运行在 MicroVM 上,与社区、电商、广告等生产服务完全不通。核心自研组件是 NEX(Native Engine for Agent Sandbox),四层架构:L1 EdithAI 网关(统一身份认证 / 流量治理 / Skill 路由 / 全链路审计)、L2 NEX 控制平面(沙箱生命周期 / 预热池 / 模板管理)、L3 底层编排运行时(自研 CRD Operator,支持批量创建与三层调度)、L4 MicroVM 安全运行时(Kata Containers + Cloud Hypervisor + 自研 Guest Kernel,六层安全防护:VM 边界隔离、Seccomp syscall 白名单、网络默认拒绝、只读文件系统、cgroup 硬限、全命令审计日志)。沙箱支持 Task、Session、Persistent、Browser 四种形态与预热池性能保障。关键指标:冷启动 P50 低于 300ms,热启动 P99 低于 50ms,热池命中率超过 70%,创建吞吐峰值 500/秒。数据安全侧,Seal 客户端内置 Security SDK 对用户输入做 PII 检测、代码秘钥扫描、文件内容扫描三重扫描(正则 + 机器学习模型),无敏感数据则请求正常发往外部模型 API,检测到敏感数据则强制路由到自部署私有化模型以保证数据不出公司网络,且对用户透明。 全员使用带来巨大模型调用量,团队把成本优化拆成正交的 Token 消耗与模型单价两个维度。降消耗侧提出 Self-GC(灵感来自 JVM 垃圾回收):类比把长程对话历史视为 Agent 运行时的虚拟 Heap,认为简单文本截断是在语义边界随手切一刀会丢失关键上下文,必须先给每段文字「上户口」再施行策略。机制为三阶段提交:Async Plan(触发 GC 周期后旁路 planner 异步 fork 当前对话前缀,规划哪些内容可以 Fold 折叠、Mask 遮罩或 Prune 剪枝,不阻塞用户交互)、Rehearsal(系统控制层本地预演,检查 ID 幻觉与误删风险并计算 token saving,发现问题自动调整策略)、Delayed Commit(GC 计划先入 pending,等到工具执行完成或用户输入等待等安全边界再提交,避免关键执行过程中上下文被改动)。线上效果:在小红书生产环境中,部署 Self-GC 的实验组白天平均输入 Token 下降 10%~15%,高峰期最大降幅接近 20%。 降单价侧团队推出 Auto 模式,核心假设是并非每个请求都需要最贵的模型。决策内核 SealRouter 是规则与模型混合判别 + cache-aware 成本约束的路由系统,含四个层面:判别模型(基于线上真实流量训练的分类模型,根据请求特征判断合适模型级别)、路由规则(强特征优先,如 tool 数量特别多、上下文特别长的请求跳过推理直接选高级模型)、成本约束(cache-aware,命中缓存时锁定当前模型避免缓存失效,需切换时评估切换收益是否大于缓存失效成本)、容灾降级(路由超时自动回退稳妥模型,保证 Auto 始终可用)。上线效果:约 75% 的请求走高性价比模型,22% 走高级模型,仅 3% 走顶级模型;对比全量使用高级模型,成本降低 69%。团队强调该降幅不是牺牲质量换来的——SealRouter 的设计原则是「不降质量降成本」,真正需要强推理能力的请求仍路由到最强模型。 针对原生 Memory 机制的四个问题(压缩与新会话失忆、memory-flush 流水账化缺乏结构化总结、dreaming 阶段多产物多导致难审计、长期记忆晋升门槛严且遗忘机制弱),团队设计三层 Memory 架构:L0 Session 层(短期上下文,SOUL.md、TOOLS.md 等配置只在此层注入、不进长期记忆)、L1 Work Log 层(事实缓冲与证据层,触发 /compact、/new 或夜间扫描时把关键事实 flush 到 memory/YYYY-MM-DD.md,关键创新是保留可回溯到原文来源的原始证据指针并用 compiled 字段跟踪编译状态)、L2 LLM Wiki 层(长期记忆与知识存储,最核心创新)。LLM Wiki 不是提问时临时拼接原始片段的传统 RAG,而是提前把事实编译成结构化 Markdown Wiki,含 index、user、entities、concepts、syntheses、sources 等相互关联的页面形成知识网络;召回也不是全量注入而是按需召回——index.md 提供目录,search() 用 BM25 + 向量混合检索相关页面,get() 获取具体内容与证据。实际效果概括为四个「可」:可继续(新会话后能接着项目问)、可溯源(回答能落到 wiki 相对路径)、可过滤(临时闲聊不进长期事实)、可维护(用户能读懂、能编辑)。规划方向是从本地走向云共享(chat 与 code 两种 Agent 模式及更多 Agent 共享同一份用户记忆)以及结合知识图谱 / GraphRAG 把个人记忆扩展到组织层面。 底层能力之上团队做生态层:Skill Hub 是技能共享平台,把 Agent 能力抽象成 Skill,平台上并存三类 Skill——平台官方提供的、个人开发的、以及团队或部门的私域 Skill,私域 Skill 可按需分享给其他人或团队,形成「用的人越多、贡献 Skill 越多、平台价值越大」的正循环(上线后 Skill Hub 数据增长健康);Cowork Studio 是面向 AI Builder 的作品发布平台,让内部开发者可以一键上传自己构建的 AI 应用,降低分发与使用门槛。团队同时给出下一代企业级智能体的演进判断:从被动响应走向主动感知(自主获取外部信息、发现问题与机会)、从任务执行走向目标驱动(理解高层目标并自行分解子任务、独立制定并执行计划)、从单一 Agent 走向主动协作(作为组织中的独立个体与人类及其他 Agent 协同)。