论文
幻觉雪球:将多智能体LLM流水线中的错误传播建模为状态转移
The Hallucination Snowball: Modeling Error Propagation as State Transitions in Multi-Agent LLM Pipelines
摘要
顺序式多智能体LLM流水线将专用智能体串联起来,却在交接处不做验证,由此形成一个后果可测量且严重的结构性缺陷。我们展示,在第一阶段注入的幻觉不只是持续存在,还会发生形态转化:原始数值事实变为推导出的计算结果,再变为叙述性文字,最后变为经编辑认可的结论。每一次转化都使可检测性近乎不可逆地退化。我们将这一现象形式化为幻觉雪球效应:一个覆盖四个状态(原始事实→推导→叙述→不可见)的一阶马尔可夫过程,各边界的实测逃逸概率分别为24.6%、48.3%和89.3%。在FinanceBench上一个4智能体金融分析流水线中自动注入346个幻觉后,gpt-4o的检测率从第1阶段的72.0%降至第4阶段的50.9%,且23.7%的幻觉在最终输出中完全未被检出。即便是测试中最强的模型(Qwen3.5-397B-A17B,第1阶段87.0%)也面临结构性上限:推算的第4阶段检测率仅约60-65%。关键在于,使用相同RAG验证工具的边界门控相较流水线末端检查,将幻觉存活率从58.4%降至16.2%(Cohen's h = -0.911,p < 0.000001),而仅靠末端检查相对无验证仅有2.3个百分点的改善。何时验证比是否验证更重要。我们的模型可预测n智能体线性流水线中的幻觉存活率,并给出最优验证资源配置方案:优先投入S1→S2边界,此处75.4%的幻觉仍可捕获,而非S3→S4边界,此处89.3%的幻觉已经逃逸。