论文
越狱需要多少次迭代?多轮 LLM 评估的动态预算分配
How Many Iterations to Jailbreak? Dynamic Budget Allocation for Multi-Turn LLM Evaluation
摘要
评估和预测 大语言模型 (LLM) 在多轮对话设置中的性能至关重要,但计算成本高昂;关键事件(例如,越狱或代理成功完成任务)通常只有在重复交互后才会出现。这些事件可能很少见,并且在任何可行的计算预算下都不会被观察到。最近的共形生存框架在触发感兴趣事件的迭代次数上构建了可靠的预测下限(LPB),但依赖于静态预算分配,这阻碍了多轮设置中的自适应性。为了解决这个问题,我们引入了通过项目优化进行动态分配(DAPRO),这是一种理论上有效的动态预算分配框架,用于限制多轮 LLM 交互中的事件时间。我们证明 DAPRO 满足预期的预算约束,并提供无分布、有限样本覆盖保证,而不需要先前保形生存方法假设的审查和事件时间之间的条件独立。一个关键的理论贡献是一种新颖的覆盖范围,它仅与样本子集上的平均审查权重的平方根而不是最坏情况的权重成比例,从而产生比之前的工作更严格的保证。此外,DAPRO还可用于在有限的计算资源下获得人口级别评估指标的无偏估计,例如越狱率。代理任务成功、LLM 越狱、有毒内容生成和 RAG 幻觉的综合实验表明,DAPRO 的覆盖范围更接近名义水平,且方差低于静态基线,同时不超过预期的预算约束。