论文
车载对话助手中多轮对话的自动评估
Automated Evaluation of Multi-Turn Dialogues in In-Car Conversational Assistants
摘要
车载会话助理 (ICA) 越来越多地集成到车辆中,以支持路线规划、车辆控制和信息访问。由于多轮交互、缺乏明确的基本事实以及严格的安全约束,确保其可靠性具有挑战性。现有的评估技术存在不足,因为它们针对单轮设置,无法捕获跨轮的约束处理、上下文保留和安全关键行为。我们提出了一个自动化框架来测试 ICA 的多轮对话功能。该系统被视为黑匣子,并通过闭环模拟进行评估,其中包括策略引导的用户模拟器、对抗性策略管理器和评估回合级失败和对话级质量的两级大语言模型评审。我们在具有 6 个 LLM 后端和 12 个人工注释者的工业 ICA 上评估该方法。与无指导的模拟相比,自动判断与人类表现出基本一致,并且策略指导在每次对话中发现的独特失败类型增加了 2.96 倍,独特失败对话的数量增加了一倍多。