论文
注意语气:语气会改变LLM的表现吗?
Mind Your Tone: Does Tone Alter LLM Performance?
摘要
大语言模型(Large Language Model,LLM)的使用正在激增,但人们观察到其表现会随提示风格与语气的不同而变化。在本研究中,我们考察提示中的语气变化是否以及如何导致LLM在客观多选题上的准确率差异。我们使用两个数据集:一个包含50道基础题、有五种语气变体的数据集,以及一个包含570道基础题、覆盖57个学科、有七种语气变体的MMLU子集。实验评估了四个高性价比的流行LLM:ChatGPT-4o、ChatGPT-5-nano、Gemini 2.5 Flash和Gemini 2.5 Flash Lite。跨模型来看,语气效应是系统性的,但高度依赖具体模型。一些模型表现出较小但统计显著的波动,另一些模型则在不同语气间出现大幅的准确率摆动。此外,我们识别出语气敏感性在学科层面的差异,并提出一个路由框架来解释语气可能如何调谐内部推理模式。我们的发现提醒用户,不要在LLM部署中假设其对语气具有稳健的可靠性。