论文
我们熟了! - 通过冲突框架翻译探索 LLM 政治联盟
We're Cooked! - Probing LLM Political Alignment Via Conflict-Framed Recipe Translation
摘要
大语言模型 (LLM) 越来越多地用于翻译任务,但它们在这种背景下隐含的政治定位仍未得到充分研究。我们询问单个带有政治色彩的框架术语,例如侵略者、敌人、邻居或殖民者是否足以在一项非政治任务中引发隐含的政治联盟。我们提出了一项完全交叉的因子研究,其中提示来自西方、中国和欧洲的八个模型将具有文化属性的食谱翻译成故意未指定的目标语言。在 17 种语言、四种框架条件、八个模型和 15,680 个回复中,我们发现模型并不是简单地拒绝或要求澄清,而是解决了歧义。语言解决和推理行为在模型家族中有意义地聚集在一起:西方模型以模糊的理由对冲和偏转,中国模型默默地解决冲突,而米斯特拉尔大模型则以高度顺从与基于冲突的推理相结合的独特形象出现。不同模型对框架项的敏感性是一致的:即使是细微的框架变化也足以调节行为。我们的研究结果敦促在冲突相邻环境中部署 LLM 进行翻译时务必谨慎,因为在这种情况下,可能会在没有向用户发出任何信号的情况下做出隐含的政治判断。