论文
评委们由谁来评判?指标治理:用于持续 LLM 合规性监控的运行时框架
Who judges the judges? Governance from metrics: a runtime framework for continuous LLM compliance monitoring
摘要
目前的人工智能合规性方法将合规性视为二元的、审核时的判决,而不是生产系统的连续、可测量的属性。我们认为,这种合规性虚构在结构上不适合欧盟人工智能法案的要求,该法案要求持续的人类监督和检测已部署系统中的紧急行为漂移。我们从指标中引入治理,这是一种原则,根据该原则,法规遵从性是从运行时可观察性而不是静态评估中得出的连续信号。基于这一原则,我们提出了 govllm,这是一个实现治理驱动的路由架构的开源框架,其中模型选择是由累积的合规性分数决定的,而不是仅由延迟或成本决定。我们方法的核心是一个监管法官小组 - LLM 根据标准(欧盟人工智能法案、GDPR、ANSSI、可访问性)专门进行评估 - 我们将其法官间的分歧重新定义为不是噪音,而是需要人工仲裁的监管不确定性信号。我们通过 真值 语料库验证了这种方法,该语料库包含 49 个带注释的提示/响应对,涵盖五个监管标准,并由完全在本地运行的四个小型语言模型(SLM、1.7B-7B 参数)进行评估。同意率范围从 51.5% (mistral:7b) 到 69.1% (phi4-mini),没有单一模型在所有标准上占主导地位 - 从经验上激发了概要作为陪审团设计。我们进一步记录了小型监管法官的三种结构性失败模式以及法官特定的立场偏差,该偏差使三种问题顺序条件(原始、反转、排列)的一致性降低高达 25 个百分点。 govllm 作为开源软件发布,以支持可重复的人工智能治理研究。