论文

Fence:面向LLM应用的专用SLM护栏

Fence: Specialized SLM Guardrails for LLM Applications

模型训练合成数据

摘要

使用闭源大语言模型(LLM)的真实应用需要超越基础内容过滤的高级安全措施。毒性、偏见等内容审核过滤有相对标准的定义,而幻觉、话题漂移与行为偏离等应用专属护栏更难建模且随用例而变。此外,数据稀缺与标注成本使创建和测试专用护栏的过程充满挑战。本工作提出用合成数据训练的小语言模型(SLM)作为LLM应用的专用护栏。我们引入一种受生成对抗网络(GAN)设计启发的新型合成数据生成方法,生成高质量合成样本,用于训练SLM编码用例特定的护栏信息、从而充当专用护栏。实验表明,在高质量合成数据上训练的SLM护栏表现超过基于提示的LLM护栏。