论文

提示稳健性取决于任务:比较 LLM 评估中的客观型和信念型问题

Prompt Robustness Is Task-Dependent: Comparing Objective and Belief-Style Questions in LLM Evaluation

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 的调查式评估通常将提示响应视为模型价值观或信念的衡量标准。当回应被视为政治价值观、社会态度或信仰的证据时,这种假设尤其脆弱。我们询问具有固定答案的客观问题和询问意见或价值观的主观问题之间的即时鲁棒性是否不同。我们在三个客观数据集(MMLU、ARC 和 CulturalBench)和三个主观数据集(政治罗盘测试、ValueBench 和世界价值观调查)上评估了四个指令调整的模型系列。对于每个问题/陈述,我们应用多种类型的提示更改,例如措辞、框架和格式的变化,并衡量模型是否在不同变体中给出相同的答案。使用二项式广义估计方程,我们发现模型、数据集、提示类别及其相互作用的显着影响。数据集类型影响也显着,数据集类型与提示类别交互作用较大。这些结果表明提示稳健性取决于问题类型、提示变化和模型。