论文
压力见品性:深度的行为对齐评估
Pressure Reveals Character: Behavioural Alignment Evaluation at Depth
摘要
评估语言模型的对齐需要测试它们在现实压力下如何行动,而不仅仅是它们声称会怎么做。虽然对齐失效日益造成现实伤害,但缺乏包含现实多轮场景的全面评估框架。我们提出一个覆盖 904 个场景、六个类别——诚实、安全、不操纵、鲁棒性、可纠正性与图谋(Scheming)——的对齐基准,经人类评分者验证为贴近现实。我们的场景让模型面对冲突指令、模拟工具访问与多轮升级,以揭示单轮评估错失的行为倾向。使用经人类标注验证的 LLM 评审评估 24 个前沿模型,我们发现即便是表现最好的模型也在特定类别存在缺口,而多数模型则全面表现出一致弱点。因子分析显示,对齐表现为一个统一构念(类似认知研究中的 g 因子),在某一类别得分高的模型往往在其他类别也得分高。我们公开发布该基准与交互式排行榜以支持持续评估,并计划在我们观察到持续弱点的领域扩展场景,并随新模型发布补充评测。
