论文
HalluWorld:通过参考世界模型进行幻觉的受控基准
HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models
摘要
幻觉仍然是 大语言模型 的主要故障模式,但现有基准测试在总结、问答、检索增强生成和代理交互方面对其操作不一致。这种碎片化使得人们不清楚在一种环境下有效的缓解措施是否可以减少跨环境的幻觉。当前的基准要么需要人工注释和可以记忆的固定参考,要么依赖于难以重现的设置中的观察。为了研究根本原因,我们引入了 HalluWorld,这是一个基于明确的参考世界公式的可扩展基准:当模型产生相对于这个世界而言是错误的可观察声明时,模型就会产生幻觉。在此视图的基础上,我们构建了合成和半合成环境,其中参考世界是完全指定的,模型的视图是受控的,并且幻觉标签是自动生成的。 HalluWorld 跨越网格世界、国际象棋和现实终端任务,实现世界复杂性、可观察性、时间变化和源冲突策略的受控变化,并将幻觉分解为细粒度的错误类别。我们在这些设置中评估前沿和开放权重语言模型,并找到一致的模式:前沿模型几乎解决了直接观察到的信息的知觉幻觉,而多步状态跟踪和因果前向模拟仍然很困难,通常不能通过扩展思维来解决。在临终场景中,模特们也在纠结何时弃权。不同探测类型和领域的故障分布不均匀表明幻觉是由不同的故障模式而不是单一功能引起的。我们的结果表明,受控参考世界为测量和减少现代语言模型中的幻觉提供了一条可扩展且可重复的路径。