论文

SafeTune:大语言模型 基于搜索的危害最小化

SafeTune: Search-based Harmfulness Minimisation for Large Language Models

模型评测安全与风险评测

摘要

大语言模型 (LLM) 的广泛采用引起了人们对其反应潜在危害的担忧。在本文中,我们首先研究了四个通用 LLM 响应的危害性。接下来,我们提出 SafeTune,这是一种基于多目标搜索的方法,可减轻危害,同时通过超参数调整和系统提示工程提高响应相关性。我们的初步评估表明,SafeTune 显着降低了 Qwen3.5 0.8B 产生的有害反应的发生率,并提高了提示反应相关性(两者都具有较大的效应量)。在我们探索的参数中,我们还发现鼓励更多地重复回答对于减少危害性同时增加相关性最有影响力。