论文

Talk2Agent:文本Agent语音接口基准测试

Talk2Agent: Benchmarking Voice Interfaces for Text Agents

模型评测智能体系统Agent任务评测评测方法与指标长程任务评测

摘要

尽管语音是与此类系统交互的越来越流行的界面,但大语言模型(LLM)计算机使用Agent通常使用干净的书面指令进行评估。语音输入引入了一个额外的故障点:转录错误可能会在Agent开始推理之前改变任务关键实体、约束或目标,而传统的 ASR 指标不能直接衡量是否保留了成功执行所需的信息。我们推出了 Talk2Agent,这是一个用于评估语音界面如何有效地将人类语音指令传达给基于 LLM 的计算机使用Agent的基准。 Talk2Agent 从 WildClawBench 和 OSWorld 构建任务的人类口语版本,并评估一系列语音接口,包括专用 ASR 模型、支持音频的 LLM、上下文偏差和基于 LLM 的本体修复。由于重复执行长期计算机使用任务成本高昂且随机,因此我们进一步提出了一种无执行、任务条件评估框架,该框架将原始任务评分器投影到可立即寻址的意图上,并测量在语音界面后保留了多少与任务相关的信息。在 WildClawBench 上,Talk2Agent 的免执行原生投影提供了一种实用的、以执行为基础的语音界面质量衡量标准,与下游任务完成情况相关,并在 32 小时的真实人类语音中将 Pearson 相关性比 WER/CER 提高了 0.246。