论文
前沿模型会在行动前寻找安全证据吗?
Do Frontier Models Seek Safety Evidence Before Acting?
摘要
前沿模型常被评估在安全信息已进入上下文后如何响应。我们研究更早的决策点:行动前是否选择获取安全相关证据。我们提出受控基准SAFE,让模型在可选证据的检索成本、概率、严重性和呈现方式不同的条件下作出部署决策。在GPT-5.5、o3、Claude Opus 4.8和Claude Sonnet 4.6中,我们发现不同证据获取策略:Opus几乎默认检查,o3最常跳过且最敏感于阈值,GPT-5.5与Sonnet居中。检查随严重性显著增加、随检索成本下降,概率影响却弱得多:把问题发生概率从10%提高到70%,检查比例最多改变21个百分点。尽管如此,各模型第一阶段理由均以期望值推理为主。成本与义务分解进一步显示,回避主要由检索阻力和对部署收益的显式威胁驱动,而非获知后产生的补救责任。反事实干预揭示行为与解释进一步不匹配:证据表述框架可在检查边界附近显著改变决策,却很少被提及;概率常被引用,因果影响却小。结果提示,部署时安全不仅取决于模型如何响应已知风险,也取决于是否获取判断行动安全所需的证据。