论文
开放式问答中推理的无参考评估
Reference-Free Evaluation of Reasoning in Open-Ended Question Answering
摘要
在高风险领域,人工智能生成的答案通常很流畅,但难以验证,特别是当它们包含多步骤推理而不是单个最终答案时。我们提出了一个基于推理的、无参考的框架来审计 LLM 生成的输出。该方法将生成的推理轨迹分解为片段,使用自然语言推理(NLI)标记局部前提-目标关系,并将这些关系组织成超图。然后,确定性向后“与”或“或”搜索会分配分段级别的审核标签,指示每个分段如何在生成的响应中扎根。我们在两种设置中评估该框架:使用 Hard2Verify 进行演绎数学推理,以及使用 UroReason 进行开放式医学推理,UroReason 是来自真实临床病例的 LLM 推理痕迹的新医生注释基准。在这些设置中,我们的 NLI 超图审计提供了比直接 LLM 作为判断基线更可靠的无参考评估信号。在临床环境中,最先进的 LLM 法官常常无法识别有问题的推理片段,过度接受流畅但基础薄弱的回答。我们的结果表明,QA 评估应该考虑推理关系如何在推理轨迹中构成,而不是仅仅依赖最终答案或 LLM 作为验证者。 UroReason 将通过 API 提供,我们的代码将作为开源发布。