论文
不生成评估:有害模型专业化的非生成评估及其在 CSAM 中的应用
Evaluation without Generation: Non-Generative Assessment of Harmful Model Specialization with Applications to CSAM
摘要
审计开放权重生成模型的微调是否存在有害的专业化已成为模型托管平台的新治理挑战。标准工具包通过精心策划的提示或红队进行生成评估,无法扩展到平台级审计,并且对于 CSAM 等生成受到法律限制的领域完全无法使用。这激发了“无生成评估”问题:评估模型能力而不产生输出。我们认为,在这种情况下,能力必须从模型的状态(其参数或内部表示)而不是其输出来推断。我们引入高斯探测,这是一种描述 LoRA 适配器如何通过测量对高斯潜在集合的响应来扰乱模型内部表示的方法。与原始权重基线不同,高斯探测可以可靠地区分良性和有害的专业化,而无需对输出进行采样。我们展示了在高风险领域的有效性,包括检测专门针对儿童性虐待材料(CSAM)的模型,其中基于产出的评估受到法律和道德的限制。我们的结果表明,高斯探测为评估高风险生成系统提供了一种可扩展的非生成替代方案,并且对权重重新缩放(一种代表性的对抗性操作)保持稳健。