论文
HalluScan:用于检测和减轻遵循指令中的幻觉的系统基准 LLM
HalluScan: A Systematic Benchmark for Detecting and Mitigating Hallucinations in Instruction-Following LLMs
摘要
大语言模型 (LLM) 在不同的自然语言处理任务中表现出了卓越的能力,但它们仍然容易产生幻觉——生成实际上不正确、不忠实于所提供上下文或与用户指令不一致的内容。我们推出 HalluScan,这是一个全面的基准框架,可以系统地评估跨越 6 种检测方法、4 个开放权重模型系列和 3 个不同领域的 72 种配置的幻觉检测和缓解。我们介绍了三个关键贡献:(1)HalluScore,一种新颖的复合指标,与人类专家判断实现了 r = 0.41 的皮尔逊相关性; (2) 自适应检测路由(ADR),一种智能路由算法,实现 2.0 倍成本降低,且 AUROC 降级仅为 0.1%; (3)系统错误级联分解揭示了跨领域的幻觉错误类型的显着差异。我们的实验表明,NLI Verification 实现了最高的总体 AUROC 0.88,而 RAV 实现了第二高的 AUROC 0.66。