论文
把对话智能体的多维评估运营化:带选择性重评与模型基准的可扩展治理管线
Operationalising Multi-Dimensional Evaluation for Conversational Agents: A Scalable, Governed Pipeline with Selective Re-evaluation and Model Benchmarking
摘要
评估零售对话智能体需要超越词汇重叠指标的方法:评估意图对齐、事实性、有用性、清晰度、语气与整体响应质量。尽管LLM即裁判方法提供人类评估的可扩展替代,生产部署带来治理、可复现性、成本、模式一致性、可溯源与可靠性方面的挑战。我们提出GenAI Evaluation:一个受治理、配置驱动的大规模零售对话系统评估管线。它经规范化、分片、异步执行与模式约束的LLM打分处理生产聊天机器人日志;评估有用性、真实性、清晰度、语气对齐与翻译专属维度。选择性重评只处理不完整、畸形或模式无效的记录;模式锁定、版本化配置、验证日志与记录级出处分明支持可审计。管线日处理约5万条记录、已评估超过两百万次交互。验证使用12,980条分层随机人工标注记录(四名受训标注员):分类覆盖14个意图、156个子意图、18个主域与129个子域;管线取得0.93的宏F1与89%的翻译人工可接受准确率。