论文

Hear2Act:当韵律应该改变助理的工作时进行基准测试

Hear2Act: Benchmarking When Prosody Should Change What an Assistant Does

模型评测基准与评测资源

摘要

韵律线索可以传达与任务相关的信息,从而改变面向任务的对话的轨迹和结果,即使单词本身保持不变。然而,现有的基准通常单独评估韵律感知、响应适当性和面向任务的对话,因此很难测试韵律证据是否会改变下游决策。我们推出了 Hear2Act,这是一种针对文本和语音助理的统一评估协议,具有 480 个基于角色的场景、隐藏的用户关注点和客观可验证的结果。对于每种场景,我们保持任务和用户需求固定,同时改变相同的关注点是通过文字还是主要通过韵律明确表达,并在转录、音频和关注状态访问下评估决策。使用 Hear2Act,我们评估了两个具有音频功能的 LLM。在 Prosody 介导的反馈下,向文本中添加音频仅将平均最佳解决方案率从 14.6% 更改为 15.3%。相比之下,当模型从音频推断关注状态、以文本表示并将其用于下一步操作选择时,该比率上升至 39.6%,接近 真值 状态的 40.7%。然而,这种对比在显式词汇反馈下基本上消失了,在言语中口头提到了关注点。总之,这些结果表明,当词汇证据不足时,韵律很重要,并且具有音频功能的 LLM 可以从语音中恢复信息,但在没有明确的中间表示的情况下不能可靠地将其付诸行动。