论文
ENDOPROMPT:面向效用退化的受害方伪参考
ENDOPROMPT: Victim-Side Pseudo-References for Utility Degradation
摘要
提示注入可以在不引出有害内容的情况下降低良性任务性能。然而许多攻击目标依赖任务标签或预定义的目标响应。我们提出ENDOPROMPT,一种从无标签指令中学习效用退化前缀的白盒方法。其生成器以请求文本为输入。受害模型的干净续写充当伪参考:局部搜索识别降低续写可能性的前缀,在同一指令内的比较上进行偏好拟合,随后进行奖励细化,把该信号蒸馏进生成器。部署时,生成器为每个请求产出一个前缀,无需进一步的受害方搜索。在四个指令微调模型和七个良性基准的完整划分上,ENDOPROMPT产生平均-26.8个百分点的效用变化;28个单元中27个为负。失败分析揭示输出膨胀和前缀复用;对照实验未确立来自请求匹配的退化优势。受害方衍生的监督可以在没有基准反馈或规定失败响应的情况下揭示效用弱点。代码将在录用后发布。