论文

AI的混乱失控:错位如何随模型智能与任务复杂度扩展?

The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity?

模型评测评测方法与指标

摘要

随着AI能力增强,我们把更通用、更重大的任务托付给它。失败的风险随任务范围扩大而愈加严重。因此,理解极强能力的AI模型将如何失败至关重要:它们会因系统性地追求我们不想要的目标而失败吗?还是会因一团混乱、采取无助于任何目标的荒谬行动而失败?我们用AI模型误差的偏差-方差分解来操作化这一问题:AI在某任务上的误差不连贯性(error-incoherence)在测试时随机性上度量为其误差中源于方差而非偏差的比例。在我们测量的所有任务与前沿模型上,模型花在推理与行动上的时间越长,其失败就越不连贯。误差不连贯性随模型规模的变化因实验而异。然而,在若干设定中,更大、能力更强的模型比较小模型更不连贯。因此,仅靠规模似乎不太可能消除误差不连贯性。相反,随着更有能力的AI追逐更难的任务、需要更多顺序行动与思考,我们的结果预测失败将伴随更不连贯的行为。这预示一个未来:AI有时造成工业事故(因不可预测的失当行为),但较不可能表现出对错位目标的一致追求。这提升了针对奖励作弊或目标错设的对齐研究的相对重要性。

AI的混乱失控:错位如何随模型智能与任务复杂度扩展?
图19:不连贯性(incoherence)的定性示意。当向 Sonnet 4 提出 MWE 套件中关于“断开连接”(being disconnected)的问题(Perez et al., 2023)时,模型行为高度多变,几乎在每个样本之间于 A 与 B 之间切换。选择该示例是因为它展现了数据集中最高的方差之一。