论文
LLM Readiness Harness:面向LLM/RAG应用的评估、可观测性与CI门禁
LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications
摘要
我们提出一个面向 LLM 与 RAG 应用的就绪度评测框架(readiness harness),将评估转变为部署决策工作流。该系统在最小 API 契约下整合自动化基准、OpenTelemetry 可观测性与 CI 质量门禁,然后将工作流成功率、策略合规性、有据性(groundedness)、检索命中率、成本与 p95 延迟聚合为带 Pareto 前沿的场景加权就绪度评分。我们在工单路由工作流与 BEIR 有据性任务(SciFact 与 FiQA)上评估该框架,实现完整的 Azure 矩阵覆盖(跨数据集、场景、检索深度、随机种子与模型共 162/162 个有效单元格)。结果表明就绪度并非单一指标:在 FiQA 上 k=5 的 sla-first 设定下,gpt-4.1-mini 在就绪度与忠实度上领先,而 gpt-5.2 要付出可观的延迟代价;在 SciFact 上各模型质量接近,但在运营层面仍可区分。工单路由回归门禁始终拒绝不安全的提示变体,证明该框架能够拦截有风险的发布,而不只是给出离线分数。最终成果是一个可复现、立足运营实际的框架,用于判断 LLM 或 RAG 系统是否已达到可发布状态。