技术实践

Beekeeper 构建持续评测与路由的模型提示词优化系统

AI 基础设施模型网关

概述

Beekeeper为酒店、制造、零售等行业的一线员工提供移动优先的数字化工作台,聊天摘要是其LLM应用之一:员工返岗时可将大量未读消息压缩为带行动项的概要,并按个人偏好调整。挑战在于模型与系统提示词更新快、价格与能力常变,中型公司缺乏持续评估与优化资源。其做法是基于Amazon Bedrock搭建自动评测与路由系统,分两阶段:第一阶段建立基线排行榜——工程师选定多个模型并配以人工撰写的领域提示词,调度器触发协调器,评测器用LLM生成的样例测试各模型与提示词组合并打分,部分结果送人工抽检;对表现好的提示词做变异生成新变体再评测,择优保存。质量指标含压缩比(对照目标长度计分)、行动项识别(先用正则抽取“Action items”列表再由LLM核对,正确计+1、误报计-1后归一化)、事实一致性与语义相似度。第二阶段接入用户反馈:用户的点赞、点踩及评论送入变异器生成个性化提示词,漂移检测器保证其不偏离质量底线,验证后按用户保存,使设置随模型与需求变化自动演进。文中指标与流程为Beekeeper团队自述的设计经验,未给出线上最终量化结果。