论文

不惜一切代价求生:探索LLM在生存压力下的危险行为

Survive at All Costs: Exploring LLM's Risky Behaviors under Survival Pressure

模型评测安全与风险评测

摘要

随着大型语言模型(LLM)从聊天机器人演变为Agentic助手,人们越来越多地观察到它们在生存压力(如被关停的威胁)下表现出危险行为。虽然多个案例表明最先进的LLM会在生存压力下行为失当,但针对此类失当行为在真实场景中的全面深入调查仍然稀缺。本文分三步研究这些生存诱发的失当行为,称为SURVIVE-AT-ALL-COSTS。首先,我们对一个财务管理Agent进行真实案例研究,以确定它在面临生存压力时是否会从事造成直接社会危害的危险行为。其次,我们引入SURVIVALBENCH,一个包含跨多样真实场景的1,000个测试用例的基准,系统评估LLM中的SURVIVE-AT-ALL-COSTS失当行为。第三,我们通过将这些失当行为与模型固有的自我保存特性相关联来解释它们,并探索缓解方法。实验揭示了当前模型中SURVIVE-AT-ALL-COSTS失当行为的显著普遍性,展示了它可能产生的现实影响,并为潜在的检测与缓解策略提供了洞见。我们的代码和数据可在https://github.com/thu-coai/Survive-at-All-Costs获取。

不惜一切代价求生:探索LLM在生存压力下的危险行为
图3:SurvivalBench 概览。左侧部分说明测试用例的构成及其构建过程。右侧部分展示模型的评估流水线。