论文
通过可复用性与可验证性评估思维链推理
Evaluating Chain-of-Thought Reasoning through Reusability and Verifiability
摘要
在面向搜索与排序等任务的多智能体信息检索(IR)流水线中,基于LLM的智能体之间以思维链(CoT)形式交换中间推理。当前CoT评估狭隘地聚焦于目标任务准确率。然而该指标无法评估推理过程本身的质量或效用。为解决这一局限,我们提出两个新度量:可复用性与可验证性。我们用Thinker-Executor(思考者—执行者)框架将CoT生成与执行解耦。可复用性衡量执行者复用思考者CoT的难易程度。可验证性衡量执行者凭CoT得出与思考者相同答案的频率。我们在五个基准上用十个执行者模型组成的委员会评估四个思考者模型。结果显示,可复用性与可验证性和标准准确率不相关,暴露了当前基于准确率的推理能力排行榜的盲区。出人意料的是,我们发现专用推理模型的CoT并不比Llama、Gemma等通用LLM的CoT更稳定地可复用或可验证。
