论文
HalluHard:一个困难的多轮幻觉基准
HalluHard: A Hard Multi-Turn Hallucination Benchmark
摘要
大语言模型(LLM)仍会产生听起来可信却无依据的事实性断言,这一问题在多轮对话中随上下文增长与早期错误级联而加剧。我们提出 HalluHard,一个困难的多轮幻觉基准,包含950个种子问题,覆盖四个高风险领域:法律案例、研究问题、医疗指南与编程。我们通过要求对事实性断言提供行内引用来操作化“有据性”。为在开放式环境中支持可靠评估,我们提出一个通过网页搜索迭代检索证据的评审流水线。它能够抓取、过滤并解析全文来源(包括 PDF),以评估被引材料是否真正支持所生成内容。在多样的前沿专有与开源权重模型上,即使使用网页搜索,幻觉仍然可观(最强配置 Opus-4.5 加网页搜索约为30%),内容内容依据关联错误持续保持高比率。最后,我们表明幻觉行为受模型容量、轮次位置、有效推理以及所需知识类型的影响。
