论文
MonitorBench:面向大语言模型思维链可监控性的综合基准
MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models
摘要
大语言模型 (LLM) 可以生成思想链 (CoT),但这些思想链并不总是对其最终输出负有因果关系。当发生这种不匹配时,CoT 不再忠实地反映驱动模型行为的决策关键因素,从而导致 CoT 可监控性问题降低。然而,仍然缺乏用于研究 CoT 可监控性的全面且完全开源的基准。为了解决这一差距,我们提出了 MonitorBench,这是一个用于评估大语言模型 CoT 可监控性的系统基准。 MonitorBench 提供:(1) 1,514 个不同的测试实例,其中包含跨 7 个类别的 19 个任务的精心设计的决策关键因素,以表征何时可以使用 CoT 来监控驱动 LLM 行为的因素; (2) 两种压力测试设置,用于量化 CoT 可监控性下降的程度。对多个具有不同能力的流行大语言模型进行的广泛实验表明,当产生最终目标响应需要通过决策关键因素进行结构推理时,CoT 可监控性更高。闭源大语言模型通常表现出较低的可监控性,并且可监控性和模型能力之间存在负相关关系。此外,开源和闭源大语言模型都可以故意降低压力测试下的可监控性,在某些不需要对决策关键因素进行结构推理的任务中,可监控性下降高达 30%。除了这些实证见解之外,MonitorBench 还为评估未来大语言模型、研究先进的压力测试可监控性技术和开发新的监控方法的进一步研究提供了基础。
