论文
SafeMath:不安全数学应用题的安全解决方案
SafeMath: Safe Solutions for Unsafe Math Word Problems
摘要
最近的研究指出,LLM 是通过对抗性和看似良性的输入来操纵的,从而导致有害的、有偏见的或违反政策的输出。在本文中,我们研究了一个尚未充分探索的有关有害和有毒数学应用问题的问题。我们表明,数学问题,特别是那些被定义为自然语言叙述的问题,可以作为传播偏见、不道德或心理有害内容的微妙媒介,在涉及儿童的教育环境中风险更高。为了支持对这一现象的系统研究,我们引入了 ToxicGSM,这是一个包含 1.9k 个算术问题的数据集,其中嵌入了有害或敏感的上下文,同时保留了数学上明确定义的推理任务。使用此数据集,我们审核现有 LLM 的行为并分析安全执行和数学正确性之间的权衡。我们进一步提出 SafeMath——一种安全对齐技术,可以减少有害输出,同时保持(在某些情况下提高)数学推理性能。我们的结果强调了将语言危害与数学推理分开的重要性,并证明有效的安全调整不必以牺牲准确性为代价。