论文

TROPT:统一和推进离散文本优化的开放框架

TROPT: An Open Framework for Unifying and Advancing Discrete Text Optimization

模型评测安全与风险评测

摘要

离散文本触发优化——搜索文本序列,当模型摄取这些文本序列时,将其引导至指定的目标——支持模型红队(例如,LLM 越狱)以及审计和可解释性。然而,离散优化器的现状阻碍了它们的采用和进步。首先,现有的优化器,当完全开源时,分散在与特定模型、目标和问题领域相关的研究代码库中。其次,优化器变体激增,每种变体都需要工程开销才能使用或扩展,并且很难进行直接比较。总之,这些提高了在现有或新领域采用优化器以及通过新策略推进优化器的门槛。我们通过 TROPT 解决了这些差距,这是第一个开源框架,它统一了离散优化器的执行并在单一界面下标准化了它们的开发。 TROPT 可以通过交换任何组件(模型、目标和优化器)轻松定制端到端优化方案,从而扩展其跨领域和新应用程序的范围。 TROPT 目前提供 30 多个优化方案,涵盖越狱和探测模型内部等应用程序,由 15 个以上优化器(涵盖白盒到黑盒访问)和 15 个以上损失构建,从基础方法到最先进的方法。为了证明它的实用性,我们在几项研究中利用了 TROPT:(i)受控的大规模实验,比较和增强 LLM 越狱的优化策略,揭示了有效但尚未被采用的技术; (ii) 将优化器从一个域(例如,LLM 越狱)移植到新域(例如,语料库中毒嵌入模型)。总而言之,TROPT 显着降低了采用和推进离散文本优化的障碍。