论文
评估即搜索:会议助理会议记录证据对齐故障的自适应发现
Evaluation-as-Search: Adaptive Discovery of Grounding Failures in Meeting Assistants
摘要
LLM 支持的会议助理已大规模部署,但对其基础保真度的系统评估仍然仅限于静态基准,而错过了与特定话语结构或推理需求相关的故障模式。我们提出了评估即搜索(EaS),这是一种反馈驱动的方法,它将质量评估框架为对会议参与者可能提出的自然问题空间的自适应搜索。 EaS 不是统一采样,而是从迭代中的评估者反馈中学习,在 UCB 评分的覆盖图和盲的多维质量评估的指导下,将探索工作集中在最有可能失败的认知需求上。使用 EaS,我们构建了 MeetingProbe,这是一个超过 3{,}000$ 带注释的问答对的基准,涵盖来自三种会议类型的 20 个记录和三个 LLM 助手。在消融中,自适应搜索的失败率比随机探测多 $2.5\time$($7.1\%$ vs. $2.9\%$ 发现率),其中战略规划者贡献最大的个人效应。在三个模型中,我们观察到明显的能力梯度,并确定了八个反复出现的失败类别,这些类别主要是话语语用挑战而不是事实回忆错误。我们进一步跨多个模型系列和提供商验证 MeetingProbe,找到一个干净的能力梯度和没有模型处理的通用故障的精选子集。 MeetingProbe 公开发布,以支持会议助理会议记录证据忠实性的可重复评估。