论文

与LLM Agent打字还是说话?语音与键盘输入扰动的综合研究

Should We Type or Talk to LLM Agents? A Comprehensive Study of Voice and Keyboard Input Perturbations

模型评测鲁棒性、公平性与可信度评测

摘要

人类输入语言模型通过打字或说话进行。每个渠道都留下不同的痕迹:键盘上的错别字;AI辅助的语音转录工具中的断句和重组。这些扰动如何影响语言模型的表现?在这篇论文中,我们展示了HIVE(Human Input-Variation Engine),一个包含语音转录扰动和QWERTY键盘扰动的系列。我们使用HIVE来评估这些扰动对模型的影响。我们呈现了七个发现:(i) 语音转录扰动会降低所有测试模型的准确性,而不仅仅是填充词的成本;(ii) QWERTY键盘扰动成本较低,模型在准确度下降前吸收了大量的扰动;(iii) 这两个通道都归因于一个问题中的词元数量是否幸存:破坏一个词元是造成伤害的主要原因,而同时添加新的词元则成本很低;(iv) 两个通道之间的差距仅出现在需要构建或推导答案的地方;在多项选择题中没有这种差距;(v) 这种损害不仅来自测试集的污染;(vi) 通过轻量级适应训练无法消除这种损害;(vii) 思考预算几乎完全恢复了键盘通道,但口语记录保持不变,压缩语音则更差。

与LLM Agent打字还是说话?语音与键盘输入扰动的综合研究:论文配图
图 1:HIVE 分类概览。用户可以即兴提出问题,也可以传递现有信息,然后通过语音、QWERTY 键盘或复制粘贴到达模型,逐字传递问题,并且是干净的参考。颜色标记通道,而不是运算符的构建方式:语音运算符是小样本 LLM 风格传输和确定性规则的混合,而键盘运算符都是确定性的。显示的每个示例都是来自已发布数据的真实项目。右侧面板显示了模型在降级输入下的响应方式。表 4 给出了完整的规格。