论文
重要的不是你说什么,而是你怎么说:评估 LLM 对信念表达的反应
It's Not What You Say, It's How You Say It: Evaluating LLM Responses to Expressions of Belief
摘要
用户经常向 大语言模型 (LLM) 表达他们的信念。在某些情况下,LLM 应该接受这些上下文信念为真。在其他方面,他们应该坚持他们先前的知识。值得注意的是,用户的信念表达 (EoB) 可以采取语言上不同的形式 - 使用预设、证据和确定性标记或不同的语气 - 每一种形式都可能对 LLM 具有不同的说服力。我们引入了一种类型学来系统地评估不同的 EoB 如何影响模型是否遵循上下文与先验知识。该类型学基于四个语言动机维度:形式、证据性、认知立场和语气,涵盖 17 种细粒度类型。通过将这些 EoB 与世界知识事实配对,我们生成受控的 EoB 查询对,以隔离语言变化的影响。使用此基准,我们评估了 16 个 LLM,它们在架构(Llama3、Qwen3、Gemma3)、规模(1B-30B 参数)和训练阶段(基础与指导)方面有所不同。我们确定了这些轴上响应行为的有意义的变化,例如,较大的模型和指令模型往往比较小的模型和基础模型不太遵循上下文。我们进一步确定了特定的 EoB,这些 EoB 在统计上比其他人更能一致地说服 LM。我们的工作揭示了语言框架如何影响 LLM 上下文集成的系统模式,对即时工程和模型稳健性具有影响。