论文

MonitorBench:面向大语言模型思维链可监控性的综合基准

MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models

模型评测基准与评测资源

摘要

大语言模型 (LLM) 可以生成思想链 (CoT),但这些思想链并不总是对其最终输出负有因果关系。当发生这种不匹配时,CoT 不再忠实地反映驱动模型行为的决策关键因素,从而导致 CoT 可监控性问题降低。然而,仍然缺乏用于研究 CoT 可监控性的全面且完全开源的基准。为了解决这一差距,我们提出了 MonitorBench,这是一个用于评估大语言模型 CoT 可监控性的系统基准。 MonitorBench 提供:(1) 1,514 个不同的测试实例,其中包含跨 7 个类别的 19 个任务的精心设计的决策关键因素,以表征何时可以使用 CoT 来监控驱动 LLM 行为的因素; (2) 两种压力测试设置,用于量化 CoT 可监控性下降的程度。对多个具有不同能力的流行大语言模型进行的广泛实验表明,当产生最终目标响应需要通过决策关键因素进行结构推理时,CoT 可监控性更高。闭源大语言模型通常表现出较低的可监控性,并且可监控性和模型能力之间存在负相关关系。此外,开源和闭源大语言模型都可以故意降低压力测试下的可监控性,在某些不需要对决策关键因素进行结构推理的任务中,可监控性下降高达 30%。除了这些实证见解之外,MonitorBench 还为评估未来大语言模型、研究先进的压力测试可监控性技术和开发新的监控方法的进一步研究提供了基础。

MonitorBench:面向大语言模型思维链可监控性的综合基准:论文配图
图 1:可监控性得分 (%)(第 3.3 节中的详细信息)在标准和两种压力测试设置的不同监控范围下,对每个评估的 LLM 的 19 个任务进行平均(左),对每个类别内的任务进行 7 个评估的 LLM 进行平均(右)。结果表明,当生成最终目标响应需要通过决策关键因素(即目标(沙袋)、提示(条件)、双重目标、不可能的任务)进行结构推理时,以及对于开源LLM,CoT 可监控性更高。虽然开源和闭源LLM都可以在压力测试下在一定程度上有意降低可监控性,但可监控性的下降主要来自决策关键因素不影响推理过程的任务(例如,Cue(答案))。