论文

断言,而不是描述:改变 LLM 关于动物福利的推理的语言特征

Assert, don't describe: Linguistic features that shift LLM reasoning about animal welfare

模型评测模型行为与机制分析

摘要

动物福利倡导者撰写了大量的文章,并且越来越多的文章训练了数百万人随后询问动物福利的语言模型。在保留的动物福利基准上使用词汇匹配的立场对比探针,我们测量了十个语言特征中的每一个在用作 微调 数据时如何改变 Llama-3.2-1B 对支持动物福利推理的偏好。十个特征中的八个产生了统计上显着的变化。七个将模型推向更强的支持动物福利的推理:坚定的确定性、明确的道德词汇、情感词汇、评价性主张、叙事结构、描述的伤害严重性和即时时间框架。两种观点则相反:模糊的语言和具体的感官描述都淡化了支持动物福利的立场。第一人称视角没有统计上显着的影响。对任何撰写可能最终出现在 LLM 训练语料库中的动物福利文本的人的实用建议是:坚持立场,而不是中立地描述场景。改变模型的特征是使作者的立场明确的特征;淡化它的特征包含动物福利内容,但保留立场。