论文

将长SKILL合规检测视为逻辑推理:基于闭包的检测与规模趋势引导的在策略蒸馏

Long SKILL Compliance as Logical Reasoning: Closure-Grounded Detection with Scaling-Guided On-Policy Distillation

上下文与知识知识图谱

摘要

企业业务场景的日益复杂推动了长篇SKILL文档在Agent系统中的广泛应用,给合规检测带来新挑战:大模型产生可观的推理成本,而小模型可能难以保持检测精度。为弥补这一缺口,我们提出SkillCDG,一个基于图的长SKILL合规检测框架。SkillCDG将复杂业务政策表示为两层约束依赖图:上层索引SKILL描述用于场景路由,下层捕捉每个SKILL内部原子约束间的依赖关系。推理时,两级检索加依赖闭包支持合规判断与来源可追溯。我们在三个企业数据集和两个受控公开基准变体上全面评估该框架。实验结果表明,SkillCDG在检测F1分数上超出基线方法最多12.8个百分点,同时最多减少64.3%的token消耗。此外,我们进一步研究政策图复杂度、模型规模与检测性能之间的内在关系。在单一模型家族四个检查点上的对比实验验证了一条简洁有效的规模趋势:端到端检测正确性呈现按复杂度分化的扩展模式,且由约束依赖图导出的复杂度度量能有效量化实例难度与模型的性能提升潜力。利用这一富有洞见的规模趋势,我们进行自适应训练样本选择,并采用在策略蒸馏(on-policy distillation)高效提升小规模模型的合规检测能力。

将长SKILL合规检测视为逻辑推理:基于闭包的检测与规模趋势引导的在策略蒸馏:论文配图
图1:相同的回答可能来自合规与不合规的程序。可靠的审计需要所适用的规则及其完整的策略前提条件集合。