论文

DeEscalWild:使用 SLM 进行自动降级训练的真实基准

DeEscalWild: A Real-World Benchmark for Automated De-Escalation Training with SLMs

模型评测基准与评测资源

摘要

有效的降级对于执法安全和社区信任至关重要,但传统的训练方法缺乏可扩展性和现实性。虽然 大语言模型 (LLM) 可实现动态、开放式模拟,但其大量的计算占用量使其无法部署在沉浸式现场训练所需的轻量级便携式硬件上。小语言模型 (SLM) 提供了一种可行的实时替代方案,但严重缺乏高质量、特定领域的训练数据。为了弥补这一差距,我们提出了 DeEscalWild,这是一个新颖的基准数据集,它是从公开视频存储库中提取的野外警察与平民互动的多阶段管道中精心策划的。从 5,000 个原始输入开始,我们采用严格的混合过滤流程,将人机交互验证与 LLM-as-a-Judge 评估相结合,提炼出 1,500 个高保真场景。由此产生的语料库包含 285,887 个对话回合,总计约 470 万个标记。大量实验表明,根据这些数据进行微调的 SLM 在 ROUGE-L、BLEU-4、METEOR、BERTScore、Realism Score 和人类评估指标方面的性能显着优于其基础同行。值得注意的是,在同等条件下进行评估时,我们经过微调的 Qwen 2.5 (3B-Instruct) 超越了通用 Gemini 2.5 Flash 模型,这表明域优化的 SLM 可以用一小部分计算成本实现卓越的性能。这项工作为边缘的可访问、低延迟和隐私保护的官员训练系统建立了基础设施。我们公开发布我们的代码(https://github.com/Hasebul/DeEscalWild-Benchmark-Framework)和数据集(https://doi.org/10.7910/DVN/CWMCZI)。