论文
通过模拟部署预测LLM发布前的安全性
Predicting LLM Safety Before Release by Simulating Deployment
摘要
部署前安全评估旨在告知发布新人工智能模型的下游风险。然而,大多数评估提供的关于部署中不良模型行为发生频率的证据有限:它们通常覆盖范围不足,不具有代表性,并且通常可被识别为测试。为了解决这些问题,我们研究了一种模拟模型部署的简单方法:从先前模型部署的去识别化对话开始,我们固定初始对话前缀并使用候选模型重新生成下一个响应。然后,可以审核所得响应是否存在新的偏差,并用于在部署之前估计模型不当行为的普遍程度。我们使用 GPT-5.4 的注册、结果盲预测以及对三个早期版本的回顾性分析来评估四个 GPT-5 系列部署的部署模拟。我们发现,部署模拟可以对部署后的不当行为率进行信息性估计,并且优于基于对抗性选择的生产数据的基线;与传统评估相比,其评估意识点估计值也更接近生产流量。我们还将工具重采样的现实性确定为进一步改进预测的核心挑战,并分享结果表明,即使在复杂的工具使用环境中,这一挑战也是可以克服的。最后,我们表明部署模拟可以从公共聊天数据集中进行播种,并保留有关生产不当行为率的信息,这为外部研究人员提供了一种无需访问私人生产日志即可运行基于部署的评估的路径。总体而言,部署模拟有助于评估人员预测语言模型在现实世界中的表现,并支持对部署风险进行更定量的评估。