论文
选择在何处以及如何进行审核:过滤器放置和响应重写中的端到端权衡
Choosing Where and How to Moderate: End-to-End Trade-offs in Filter Placement and Response Rewriting
摘要
内容审核分类器通常是单独评估的,但部署需要选择干预位置以及标记后的内容。我们使用两个端到端客户结果指标而不是组件准确性来评估这些选择:有用性,即显示出无害相关响应的匝数分数,以及有害暴露,即显示出有害响应的分数。延迟和错误率是诊断。我们在人工标记的产品基准和公共 ToxicChat 评估上比较了仅输入、仅响应和输入 + 响应硬阻止。在评估的操作点,响应仅在两种设置中实现最高的仅滤波器有用性,而输入+响应实现较低的有害暴露。对于所选配置,将仅响应阻塞替换为响应 + 重写可恢复大多数阻塞流量,并产生与仅响应阻塞相同的观察到的有害暴露计数;这种平等不是等价结果。相对于 LLM 布线,在可比较的测量结果下,探测布线大大减少了条件布线和生成时间。重点输出审查显示如何通过概括触发语言来重写平衡过滤器通道的有用性,同时保留良性意图和安全重定向;然而,一些敏感域输出忽略了潜在的安全相关支持信息。这些结果支持在特定于部署的安全性和延迟限制下比较审核配置,而不是应用通用放置规则。代码和公共工件可在 https://github.com/microsoft/mod-frontier 获取