论文
LexAgentHallu:法律Agent幻觉的分层诊断基准
LexAgentHallu: A Hierarchical Benchmark for Profiling Hallucinations in Legal Agents
摘要
随着大型语言模型越来越多地被部署为工具增强的法律智能体,它们引入了智能体幻觉,其中工具调用和推理错误会级联成捏造的持有和错误的权威。然而,现有的法律基准仅评估具有结果级别指标的单轮 QA,而智能体幻觉基准缺乏特定于法律的诊断能力。两者都没有回答法律智能体在其轨迹上产生幻觉的程度和方式。为了解决这些局限性,我们引入了 LexAgentHallu,这是一种法律智能体幻觉基准,旨在评估法律智能体在多步骤轨迹上失败的程度和方式。 LexAgentHallu 通过四阶段专家循环管道构建,包含 17 个法律类别和 6 种任务类型的 3414 个实例。每个实例都根据 7 个高级类别和 27 个细粒度子类的双层幻觉分类法进行注释,涵盖实质性错误和智能体程序故障。我们进一步设计了细粒度的指标,可以量化智能体执行路径上每个故障发生的程度并本地化。我们对 18 个专有和开源智能体的评估揭示了正确答案错误原因效应,并揭示了幻觉子类聚集而不是分散,形成了独特的智能体框架、法律任务和类别概况。这些结果水平评估不可见的发现验证了 LexAgentHallu 在法律上评估智能体幻觉的诊断能力。