论文

了解 大语言模型 中的音调相关推理成本

Understanding Tone-Dependent Inference Cost in Large Language Models

模型评测模型行为与机制分析

摘要

我们研究提示音如何影响 LLM 答案的准确性和输出词元消耗中反映的推理成本。我们进行了实验,以了解 LLM 模型的 570 个问题 MMLU 数据集的准确性和推理成本之间的权衡,并以从阿谀奉承到威胁的七种不同语气提示。我们的结果表明,所有模型的输出词元长度变化大大超过了准确度变化。不同措辞语气条件下输出词元消耗的差异高达 44.3%。我们还分析了推理过程中答案的准确性和平均输出标记长度之间的权衡。对于 ChatGPT 4o 和 5-nano 型号来说,粗鲁的语气相当占主导地位。对于 Gemini 型号 2.5 Flash 和 2.5 Flash Lite,粗鲁和中性色调在帕累托最优边界上占主导地位。我们发现提示音不仅影响答案质量,还影响现代 LLM 消耗的计费推理资源量。