论文
使用模拟工具调用来隔离不受信任的提示输入进行评估
Evaluating using Mock Tool Calls to Quarantine Untrusted Prompt Inputs
摘要
大语言模型 必须经常处理不受信任的输入,例如判断另一个模型的答案或在对抗压力下运行垃圾邮件和危害分类器等任务。这些输入通常以字符串格式直接格式化为提示模板,使系统容易被操纵。 OpenAI 等主要提供商当前的 LLM 规范区分了指令层次结构的可信度,从系统消息(最可信)到工具结果(最不可信)。一种可能的自然缓解措施是将不受信任的内容包装在模拟工具调用中作为隔离区。我们通过对七个模型和三个 LLM-as-a-Judge 任务的静态攻击字符串进行自动红队搜索来探索这一假设。与我们的假设相反,工具包装并没有广泛提高稳健性。在二进制评估任务(GSM8K 分级)中,它通常会提高攻击成功率,这是指令层次结构的明显倒置。在标量和成对任务中,效果较小且依赖于模型,没有经过测试的模型能够可靠地提供帮助,并且有几个模型显示出反转。我们建议在已部署的系统中评估此限制,并从长远来看,追求更强大的指令层次结构训练或新的不可信输入原语。