论文

没有规则的判决:诊断和审计LLM合规系统中的监管规则敏感性

Verdict Without the Rule: Diagnosing and Auditing Regulatory Rule Sensitivity in LLM Compliance Systems

模型评测模型行为与机制分析安全与风险评测

摘要

部署大型语言模型合规系统的假设是,判决取决于所给出的监管规则。我们直接在五个模型和 20 个监管和平台政策域中进行测试:在保持案例固定的情况下删除、交换或否定管理规则,并检查判决是否发生变化 (OCS) 或模型的合规性内部表示是否发生变化 (ICS-delta)。两者都没有太大的变化:模型的判决通常对于所提供的规则的实质性扰动是不变的,而这里根据其本地分类法的自定义规则改编进行评估的警卫模型是这五个模型中对规则最不敏感且最不准确的,几乎不高于机会(51%,而通用模型为 90-92%)。这反映了简单的情况,而不是一刀切的忽视:在删除规则改变了先前正确的模型预测的情况下,模型确实会密切跟踪它。更好的提示或对模型内部表征的直接干预都无法弥补这一差距。仅凭准确性并不能证明合规性判决是基于所提供的信息 规则。