论文
LLM Performance Predictors:在人机混合审核系统中学习何时升级人工审核
LLM Performance Predictors: Learning When to Escalate in Hybrid Human-AI Moderation Systems
摘要
随着LLM日益融入人在环路的内容审核系统,一个核心挑战是判断其输出何时可以信任、何时更适合升级为人工审核。我们提出一个用于有监督LLM不确定性量化(supervised LLM uncertainty quantification)的新框架,学习一个专门的元模型,该模型基于从LLM输出导出的LLM Performance Predictors(LPP):对数概率、熵以及新型的不确定性归因指标。我们证明,该方法能够在真实的人机工作流中实现成本感知的选择性分类:升级高风险案例,同时自动化其余部分。在多个最先进LLM上的实验——包括现成模型(Gemini、GPT)与开源模型(Llama、Qwen)——覆盖多模态与多语言审核任务,结果表明该方法在准确率-成本权衡上显著优于现有不确定性估计器。除不确定性估计之外,LPP还通过为失败条件(例如内容含糊与政策规定不足)提供新见解来增强可解释性。这项工作为不确定性感知、可扩展且负责任的人机审核工作流建立了一个有原则的框架。
