论文
SIRF:面向工业内容风控的规范内化基础模型
SIRF: A Spec-Internalized Risk Foundation Model for Industrial Content Risk Control
摘要
对于工业内容风控来说,真正的部署约束不是平均准确率,而是在高精度和秒级延迟的情况下能够自动处理多少风险。我们提出了 SIRF(规范内部化风险基础模型),它将平台的复杂策略内部化,通过 EntiGraph、MAGA 重写和帐户级思想链 (CoT) 无需额外的人工注释即可合成,并通过持续预训练 (CPT) 转化为权重,因此在超低延迟、仅判决部署下以高精度应用规则。受控的同源比较(Qwen3-8B-SFT 与 SIRF-8B-SFT,相同的策略注入和仅判决输出形式,仅基于策略的 CPT 不同)将增益归因于内部化:SIRF-8B-SFT 达到 71.3% Black Recall@P95,比基线高出 15.1pp,仅使用约 70M CPT Token而不损害一般能力,并且在包含的 logprob 可用模型中这个接口可以匹配或超过更大的系统。 SIRF 被部署为树模型裁决层(恢复的误罚样本增加了 20%),并以低成本转移到冻结场景(相对误罚减少约 70%)。