论文
超越最终答案:审计多智能体工业工作流中的轨迹级幻觉
Beyond Final Answers: Auditing Trajectory-Level Hallucinations in Multi-Agent Industrial Workflows
摘要
大语言模型(LLM)正越来越多地被部署为能推理、使用工具并跨多步行动的自主智能体。然而大多数幻觉基准仍只评估最终输出,遗漏了源自中间Thought-Action-Observation步骤的失败。我们提出Trajel,一个用于审计多智能体工业工作流中轨迹级幻觉的数据集与评估框架。Trajel针对来自AssetOpsBench的专家标注智能体轨迹,引入了五类幻觉分类法(事实性、指涉性、逻辑性、程序性和范围性)。我们在子任务、轨迹和长上下文层面对有监督检测模型进行基准测试。结果表明,最常见的失败模式被现有基准所遗漏,近一半的幻觉轨迹同时涉及多种类型,而二元准确率很高的自动检测器仍会误分类最微妙的类型。轨迹感知检测显著优于标准的事后验证,这表明以分类法为基础的评估对更安全的智能体部署不可或缺。
