论文

LLM Performance Predictors:在人机混合审核系统中学习何时升级人工审核

LLM Performance Predictors: Learning When to Escalate in Hybrid Human-AI Moderation Systems

模型评测评测方法与指标

摘要

随着LLM日益融入人在环路的内容审核系统,一个核心挑战是判断其输出何时可以信任、何时更适合升级为人工审核。我们提出一个用于有监督LLM不确定性量化(supervised LLM uncertainty quantification)的新框架,学习一个专门的元模型,该模型基于从LLM输出导出的LLM Performance Predictors(LPP):对数概率、熵以及新型的不确定性归因指标。我们证明,该方法能够在真实的人机工作流中实现成本感知的选择性分类:升级高风险案例,同时自动化其余部分。在多个最先进LLM上的实验——包括现成模型(Gemini、GPT)与开源模型(Llama、Qwen)——覆盖多模态与多语言审核任务,结果表明该方法在准确率-成本权衡上显著优于现有不确定性估计器。除不确定性估计之外,LPP还通过为失败条件(例如内容含糊与政策规定不足)提供新见解来增强可解释性。这项工作为不确定性感知、可扩展且负责任的人机审核工作流建立了一个有原则的框架。

LLM Performance Predictors:在人机混合审核系统中学习何时升级人工审核
图4:LPPs 作为跨领域的不确定性路由器。该元模型利用不确定性信号在自动化决策与人工审核之间进行路由,适用于内容审核、欺诈检测、合规与医疗分诊。示意图展示 LPPs 作为中心方框,通过箭头与周围的组件相连。上方三个分别标注为 Labeled training data、Pre-response signals 和 Cost modeling 的方框汇入 LPPs;下方三个分别标注为 Moderation、Fraud detection 和 Medical triage 的方框接收来自 LPPs 的输出。虚线箭头表示弃权信号。