论文

SMTrap:通过 SMT 冲突指导对大型推理模型进行经济高效的 DoS 攻击

SMTrap: Cost-Effective DoS Attacks Against Large Reasoning Models via SMT Conflict Guidance

模型评测安全与风险评测

摘要

现有的LRM-DoS方法严重依赖模型反馈来合成攻击查询,需要对目标模型进行重复查询或训练专用的攻击模型。这些昂贵的操作严重削弱了攻击杠杆。在本文中,我们提出了 \emph{搜索放大},一种新颖的、无模型反馈的 LRM-DoS 范式。它采用源自可满足性模理论 (SMT) 求解器的冲突计数作为低成本外部信号来指导推理繁重的约束满足问题 (CSP) 实例的合成。我们的主要观察结果是,LRM 在解决 CSP 时依赖于试验和回溯搜索,其中给定 CSP 实例上较高的 SMT 冲突计数与更广泛的 LRM 回溯搜索和更长的输出轨迹呈正相关。基于这一发现,我们提出了 \textsc{SMTrap},一个轻量级的、仅 CPU 的框架。在 SMT 冲突计数的指导下,\textsc{SMTrap} 生成大量推理的 CSP 查询,无需模型查询、攻击 模型训练 或 GPU 计算。对七个前沿模型的评估证明了 \textsc{SMTrap} 最先进的 LRM-DoS 功能,产生的 DoS 效果比现有基线强数倍。为了减轻 \textsc{SMTrap} 的威胁,我们演示了一种基于工具的缓解措施,可以显着减少词元的使用。