论文
你的深度研究智能体为何失败?论完整研究轨迹中的幻觉评估
Why Your Deep Research Agent Fails? On Hallucination Evaluation in Full Research Trajectory
摘要
诊断深度研究代理 (DRA) 的故障机制仍然是一个严峻的挑战。现有的基准主要依赖于端到端评估,掩盖了在整个研究轨迹中积累的关键中间幻觉,例如有缺陷的规划。为了弥补这一差距,我们建议通过审核完整的研究轨迹,从基于结果的评估转向过程意识的评估。我们引入 PIES 分类法,按照功能组件(规划与总结)和错误属性(显式与隐式)对幻觉进行分类。我们将这种分类法实例化为一个细粒度的评估框架,该框架分解轨迹以严格量化这些幻觉。利用这个框架来隔离 100 个明显容易产生幻觉的任务,包括对抗场景,我们策划了 DeepHalluBench。对六种最先进的 DRA 进行的实验表明,没有任何系统能够实现稳健的可靠性。此外,我们的诊断分析将这些故障的病因追溯到系统缺陷,特别是幻觉传播和认知偏差,为指导未来的架构优化提供了基础见解。数据和代码可在 https://github.com/yuhao-zhan/DeepHalluBench 获取。
