论文

Penumbra:针对监管义务的样本高效对抗性搜索

Penumbra: Sample-Efficient Adversarial Search for Regulatory Obligations

模型评测安全与风险评测

摘要

智能体正在进入金融、医疗保健和法律领域,这些领域的违规行为不会留下任何词汇签名,并会受到真正的处罚。遗漏是否重大,或者披露是否充分,取决于答复中遗漏的内容。探索这样的义务意味着通过翻转合规性来找到一个最小的编辑响应,并且每个探针都需要一代人的时间和两次裁决,因此对监管红队的约束是样本效率,而不是数量。我们引入了 Penumbra,这是一种对抗性搜索,它在不断扩大的编辑预算下从经过验证的锚点开始,直到由两名评估者组成的委员会改变其裁决,并发出跨越变化的两个相邻响应。分配是自适应的,目标是覆盖失败面:每个候选者解析不同的(义务 x 失败模式)单元格。在匹配预算的情况下,自适应分配对 59% 的候选人达到统一分配的全额预算覆盖率;在同等记录下,它覆盖的失败模式是朴素枚举的 1.43 倍,并且增益仅限于其目标轴。在财务咨询章程的 60 项筛选义务中,Penumbra 返回 144 对,每对都是合规和违规的回应,委员会将其置于边界的两侧,区别在于少数几个单词,而模型要求两者直接生成几乎没有任何共享的文本。用于临床分类的第二个构成在 18 个义务上重现了这一点:49 对具有相同的松紧度,具有相同的最难模式。像这样的对显示了义务本身的条款在哪里停止决定,这是在其下部署的智能体必须测试的内容,并且搜索发现它们的成本与边界而不是文本成比例。