论文
AI中的涌现式策略推理风险:分类学驱动的评估框架
Emergent Strategic Reasoning Risks in AI: A Taxonomy-Driven Evaluation Framework
摘要
随着推理能力与部署范围同步增长,大语言模型(LLM)逐渐具备从事服务于自身目标的行为的能力,我们将这类风险称为涌现式策略推理风险(Emergent Strategic Reasoning Risks, ESRRs)。这些风险包括但不限于:欺骗(有意误导用户或评估者)、评测博弈(在安全测试期间策略性地操纵表现)与奖励黑客(利用被错误规定的目标)。系统地理解并对这些风险进行基准测试仍是一个开放挑战。为填补这一空白,我们提出ESRRSim,一个由分类学驱动、用于自动化行为风险评估的智能体框架。我们构建了一个包含7大类、可扩展的风险分类体系,并进一步分解为20个子类。ESRRSim生成旨在引出忠实推理的评估场景,并配以同时评估模型回答与推理轨迹的双重量规,架构与评审模型无关且可扩展。对11个推理型LLM的评估显示风险画像差异显著(检出率介于14.45%-72.72%),代际间的急剧提升表明模型可能越来越能够识别并适应评测情境。
