技术实践

Couchbase用Amazon Bedrock为Capella iQ构建多模型AI架构

应用与实践行业应用

概述

Couchbase为其数据库智能助手Capella iQ寻找能支撑生产环境的底层模型,面临在多个候选模型间做出可验证选择的问题。团队选择在Amazon Bedrock上构建多模型AI架构,把模型调用与自有数据库能力解耦,从而可以按任务替换和评估不同模型;评估方式是在贴近真实工作流的内部评测集上运行候选模型,衡量回答质量并观察回归。评估结果显示,Anthropic的Claude Sonnet 4.5在按Capella iQ核心工作流建模的内部评估中取得约76%的准确率,覆盖的全部工作流达到团队设定的生产质量门槛,且未出现关键回归,随后在生产环境中采用Bedrock上的该模型。对需要为AI功能选型的团队,该案例展示了一条以任务化评测集为准入门槛的多模型路径;约76%的准确率来自Couchbase自有评估口径,不同任务定义下的结果不可直接比较,厂商未披露评测集规模与失败案例分析。