论文

模型催眠:通过附加的潜意识效应对人工智能进行强有力的控制

Model Hypnosis: Strong control of AI via additive subliminal effects

模型评测模型行为与机制分析

摘要

我们证明人工智能模型很容易受到一种我们称之为模型催眠的现象的影响,在这种现象中,提示中单独的微弱且看似不相关的线索可以系统地组合起来,以强有力地控制模型的行为。模型催眠发生在模型家族和尺度上,包括前沿推理模型,并且催眠提示可以在模型之间转移。由于模型是由不显眼的文本选择(例如释义和拼写错误)控制的,因此模型催眠为人工智能安全带来了新的挑战和途径,也是人工智能可解释性的主要障碍。