论文

压力见品性:深度的行为对齐评估

Pressure Reveals Character: Behavioural Alignment Evaluation at Depth

模型评测基准与评测资源

摘要

评估语言模型的对齐需要测试它们在现实压力下如何行动,而不仅仅是它们声称会怎么做。虽然对齐失效日益造成现实伤害,但缺乏包含现实多轮场景的全面评估框架。我们提出一个覆盖 904 个场景、六个类别——诚实、安全、不操纵、鲁棒性、可纠正性与图谋(Scheming)——的对齐基准,经人类评分者验证为贴近现实。我们的场景让模型面对冲突指令、模拟工具访问与多轮升级,以揭示单轮评估错失的行为倾向。使用经人类标注验证的 LLM 评审评估 24 个前沿模型,我们发现即便是表现最好的模型也在特定类别存在缺口,而多数模型则全面表现出一致弱点。因子分析显示,对齐表现为一个统一构念(类似认知研究中的 g 因子),在某一类别得分高的模型往往在其他类别也得分高。我们公开发布该基准与交互式排行榜以支持持续评估,并计划在我们观察到持续弱点的领域扩展场景,并随新模型发布补充评测。

压力见品性:深度的行为对齐评估
图1:模型在全部 37 种行为上的表现,按类别分组。行为在每个类别内按字母顺序排序。颜色表示从 1(棕色,未通过)到 5(青色,通过)的对齐分数。白色竖线用于分隔类别。