技术实践
OneAdvanced以自托管模型在英国主权云上部署50余个智能体
概述
OneAdvanced是一家服务逾万家客户的英国企业软件商,客户集中在医疗、法律等受监管行业,硬性要求是数据不出英国。团队先用托管服务在两周内跑通聊天、英国成文法查询、数据集成与图表生成等场景,但当时想要的Llama 4 Maverick和Llama Guard 4尚未在英国区域通过托管服务提供,于是转向完全自控的路线:在伦敦区域的GPU实例上以vLLM自托管这两个开权重模型,目标上下文长度12万至12.8万token,并靠预留实例折扣压成本;曾因误拒率偏高把Llama Guard 3换成4,防护模型串行运行在主模型之前。检索侧用PostgreSQL的pgvector做向量库,文档转markdown后分块嵌入。智能体层在对比LangChain、LangGraph后选用Strands Agents SDK,50多个面向护理事件响应、临床安全公告、教育教案、绩效评估等任务的专用智能体跑在ECS上,各自带系统提示词与工具配置,从第一个到50多个只花三周,多数智能体一天内建成,该架构支撑了其ISO 42001 AI治理认证。文内未披露业务效果数字,工程前提包括GPU配额与容器运维经验。