论文
深度研究可靠吗:误导性知识诱发错误结论
Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions
摘要
深度研究智能体经迭代规划、检索证据并生成报告执行长程调查。但它们能否抵抗被引入这些工作流的、看似可信实则错误的信息,仍不清楚。为研究该失败模式,我们提出MisKnow-Agent——一个受控评估框架:构造支持经人工审计的错误结论的任务专属文档,带受控的权威线索与来源风格。应用于DeepResearch Bench的任务,过滤后生成5,933份误导文档。我们以三个底座LLM评估DeerFlow与WebThinker,连同Gemini Deep Research,使用报告级错误结论采纳率(FCAR)——只统计认可错误结论的报告。跨配置:注入一份误导文档使平均FCAR从无注入对照的0%升至54.7%。FCAR随生命周期阶段与框架设计大幅变化,也随来源权威与呈现风格变化,而搜索结果排名与首份之外的追加文档影响有限。尽管跨模型验证一致地把留存实例分类为误导,深度研究智能体仍会在长程研究中采纳相应错误结论。研究前与研究后防御降低FCAR但不消除采纳,提示在证据进入中间研究状态与最终综合时都需要持续验证。为便于复现,代码与数据集公开于GitHub与Hugging Face。
