论文
面向已部署三语公共空间智能体的以故障为中心的运行时评估
Failure-Centered Runtime Evaluation for Deployed Trilingual Public-Space Agents
摘要
本文提出PSA-Eval,一个面向已部署三语公共空间智能体的以故障为中心的运行时评估框架。其核心主张是:当评估对象从静态的输入-输出映射转向运行时系统时,分析的基本单元应从分数转向故障。PSA-Eval把传统的Question -> Answer -> Score -> End链条扩展为Question -> Batch -> Run -> Score -> Failure Case -> Repair -> Regression Batch,使故障可追踪、可复核、可修复、可回归测试。该框架使用三语等价输入作为受控探针,以观察群体级的跨语言策略漂移。我们在一家国际金融机构大堂部署的真实三语数字前台系统上开展了一项试点研究。该试点采用简化的单一基础模型设置(MA = MB),因此观察到的漂移不应被解读为A/B基础模型差异。研究包含81个样本,组织成27个三语等价问题组。尽管该系统平均得分达到23.15/24,仍有14个组出现非零的跨语言分数漂移,5个组的漂移至少3分,最大漂移达到9分。这些结果提供了初步证据,表明以故障为中心的运行时评估能够暴露被聚合评分掩盖的结构化部署信号。
