论文
推理表示有助于人类评估 LLM 输出吗?
Do Reasoning Representations Help Humans Evaluate LLM Outputs?
摘要
推理表示越来越多地用作 大语言模型 输出的解释。然而,它们通常是根据以模型为中心的标准进行评估的,例如答案准确性和 忠实性,因此不清楚它们是否可以帮助人们评估模型响应。在这项工作中,我们将推理表示研究为面向人的界面,而不是模型推理能力的代理。我们对不同复杂性任务中的六种推理格式进行了受控人类研究,并得到基于网络的框架的支持,该框架随机化任务域、问题实例和表示顺序。该研究收集了结构理解、错误检测和定位以及信任校准的细粒度判断。我们的研究表明感知偏好与对人类评估的支持之间不匹配。参与者更喜欢基于规划和分解的表示,但更简单的思维链轨迹更好地支持验证、信任和可解释性。首选的表示方式还会引入校准风险,尽管验证意愿较低,但正确轨迹上的误报较多,且信任度较高。