论文
从离线代理指标到在线决策:面向对话式 AI 的分层参与度评测框架
From Offline Proxies to Online Decisions: A Layered Engagement Evaluation Framework for Conversational AI
摘要
在线 A/B 实验是用户参与度决策的标准,但流量与读出时间限制了可测试的对话式 AI 改动数量。我们要问:一个无需处理组用户暴露即可计算的离线信号,是否与这些实验的结果一致。我们贡献一个可复用的构造与诊断清单,把离线代理指标视为由三层对齐组成的链条:行为标签到产品结果、学习到的分类器到候选助手行为、聚合的离线信号到实验效应。配套的评测协议通过区间感知的决策一致性(比较离线与在线置信区间而非点估计)和实验内排序来审计整个组合。我们评估的具体实例包括:一个对候选行为打分的固定评测套件、一个预测会话/提示级参与度的参与度分类器,以及把样本级分数差映射到在线模型级参与度增量的校准层。随后我们报告审计结果:来自部署中多轮助手 27 个实验的 489 组离线-在线配对对比(一个候选臂对其对照臂),覆盖从模型检查点到系统提示调优。主要检验使用映射冻结之后运行的 8 个实验的 113 组对比:在这些对比上,组合指标达到 81.1% F1,而其底层的原始分类器分数仅为 34.3%,且在原始分数做出 31 次错误方向判断的场合零误判。所有离线预测都在实验运行之前计算,以防止过拟合。证据支持用该组合指标在稀缺实验流量分配之前对候选进行排序——在我们的实验部署中,用于在训练检查点之间选择与调优系统提示。