论文

HalluHard:一个困难的多轮幻觉基准

HalluHard: A Hard Multi-Turn Hallucination Benchmark

模型评测基准与评测资源

摘要

大语言模型(LLM)仍会产生听起来可信却无依据的事实性断言,这一问题在多轮对话中随上下文增长与早期错误级联而加剧。我们提出 HalluHard,一个困难的多轮幻觉基准,包含950个种子问题,覆盖四个高风险领域:法律案例、研究问题、医疗指南与编程。我们通过要求对事实性断言提供行内引用来操作化“有据性”。为在开放式环境中支持可靠评估,我们提出一个通过网页搜索迭代检索证据的评审流水线。它能够抓取、过滤并解析全文来源(包括 PDF),以评估被引材料是否真正支持所生成内容。在多样的前沿专有与开源权重模型上,即使使用网页搜索,幻觉仍然可观(最强配置 Opus-4.5 加网页搜索约为30%),内容内容依据关联错误持续保持高比率。最后,我们表明幻觉行为受模型容量、轮次位置、有效推理以及所需知识类型的影响。

HalluHard:一个困难的多轮幻觉基准
图4:我们基于断言(claim)的验证流水线。对每条 claim,我们检查参考内容是否正确,以及所声称的内容是否以该参考为依据。