论文
迷失翻译:衡量非母语英语对大语言模型最终用户性能的影响
Lost in Translation: Measuring the Effect of Non-Native English on End User Performance of Large Language Models
摘要
大语言模型 (LLM) 越来越多地被母语不是英语的人使用,但这些用户收到的回复质量明显低于流利的使用者。非母语英语的哪些具体特征造成了这种差距目前尚不清楚,因为流畅性本身就是机械准确性、词汇使用、组织和话语连贯性的综合体。在这里,我们介绍 FABLE,这是一个受控数据集,包含 190,911 个英语提示变体,这些变体源自 174K 个真实用户的写作相关任务提示。通过评估 34 名开放权重大语言模型的回答,我们发现了明显的不对称性;虽然模型不会将拼写错误等表面错误传播到其输出中,但模型确实反映了用户提示中存在的更高级别的修辞和词汇质量。此外,最不流畅的提示和最流畅的提示之间的总体响应质量差异很大。这些结果凸显了非英语母语 LLM 用户的一个关键 LLM 表现差异,导致答案质量较低且不太流畅。