论文

评估游戏:超越静态 LLM 基准测试

The Evaluation Game: Beyond Static LLM Benchmarking

模型评测安全与风险评测

摘要

随着 大语言模型 中不断发现越狱、绕过安全限制的对抗性制作的输入,从业者越来越依赖 微调 作为防御策略。然而,这种稳健性 微调 背后的理论基础仍未得到充分探索。我们引入了一个博弈论框架,其中评估者(审核越狱模型)和训练者之间的交互被形式化为两人游戏。我们方法的一个关键特征是使用群动作(一种捕获对称性和变换的数学结构)来正式表示数据增强。最简单的非平凡实例是具有循环翻译组的圆,我们在其中根据训练器的泛化范围展示各种机制。低于临界阈值时,评估器在线性多轮中保持恒定的缺失率,而其他设置可能会产生非常不同的行为。我们进一步提供了支持模型局部依赖性的经验证据:对于我们测试的三个模型系列(Llama、Qwen 和 Mistral),我们有重要证据表明对抗性提示上的 微调 仅引起局部泛化,测试示例的拒绝率与到 微调 提示的距离高度相关。我们的框架重塑了对抗性评估的中心对象:基准不是一组静态的提示,而是评估者群体行动下的轨道,而忽略训练者端适应的审计协议无法区分真正的修复与记忆的补丁。