论文

通过推理时计算和部署脚手架提高评测真实性

Improving Evaluation Realism with Inference-Time Compute and Deployment Scaffolds

模型评测安全与风险评测

摘要

一致性评估的一个核心障碍是评估意识:有能力的模型可以判断它们何时正在测试而不是部署,从而削弱了安全评估可以支持的结论。我们提出了两种技术,使模拟对齐评估更难以与真实部署区分开来。我们的第一种技术,批判细化,在每个模拟器动作上花费额外的推理时间计算:模拟器生成多个候选动作,使用来自目标模型实例的反馈来细化它们,以使其更加真实,并继续使用最像部署的候选动作进行评估。我们的第二种技术 DISH(部署模拟 SWE 代理线束)将目标包装在代理线束中,从而缩小了编码设置中模拟部署环境与真实部署环境之间的差距。我们在多个目标模型上测试了这些技术,发现它们是组合在一起的:应用这两种技术比单独使用任何一种技术都能产生更大的真实感增益。我们的结果表明,自动化方法可以提高对齐评估的真实性,并且这些改进比延长审核时间更有效地使用额外的计算。

通过推理时计算和部署脚手架提高评测真实性:论文配图
图8:部署任务重新创造的结果。精细的改进提高了所有四项目标的实事求是赢得率而不是基线,而《残疾和健康分类》则增加了三项目标,但两者的结合并没有一贯地优于较强的个人方法。在Sonnet 4.6和Opus 4.8上,最佳的单方法赢率仍然低于20%,这表明环境与现实存在巨大差距。