论文

TEMPER:在定量推理中测试情绪扰动

TEMPER: Testing Emotional Perturbation in Quantitative Reasoning

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 接受以干净、情感中性语言编写的定量推理任务的训练和评估。然而,现实世界的查询常常充满挫败感、紧迫感或热情。当保留所有数字内容时,仅情感框架是否会降低推理能力?为了研究这一点,开发了一个受控情绪翻译框架,将问题重写为情绪变体,同时保留所有数量和关系。使用该框架,跨 GSM8K、MultiArith 和 ARC-Challenge 构建 Temper-5400(5,400 个经过语义验证的情感中性对),并在 18 个模型(1B 到前沿规模)上进行评估。出现两个核心结果:首先,即使所有数字内容都被保留,情绪框架也会使准确度降低 2-10 个百分点。其次,中和情感变体可以恢复大部分损失的性能,这表明性能下降与情感风格而不是内容损坏有关,而且中和可以作为轻量级推理时间缓解措施。非情感释义不会导致这种退化,暗示情感内容而不是表面水平的变化。除了情感之外,基准构建程序还为文体翻译和鲁棒性评估提供了可控工具。