论文

修改还是重新解决?分解多 LLM 管道中的第二遍增益

Revision or Re-Solving? Decomposing Second-Pass Gains in Multi-LLM Pipelines

模型评测模型行为与机制分析

摘要

多 LLM 修订流程(其中第二个模型审查并改进第一个模型生成的草稿)被广泛认为是从真正的纠错中获得收益。我们通过受控分解实验质疑这一假设,该实验使用四个匹配条件将第二遍增益分成三个附加组件:重新求解、支架和内容。我们在知识密集型 MCQ 和竞争性编程的三个基准上跨两个模型对评估了这种设计。我们的结果表明,多次 LLM 修订的收益并不是单一的,而是取决于任务结构、草稿质量和草稿信息类型。在 MCQ 任务中,答案空间受到限制,草稿提供的结构指导很少,大多数收益与更强的模型重新求解一致,并且直接将查询路由到更强的模型可能比修改弱草稿更有效。然而,在代码生成任务中,两阶段提示仍然有用,因为即使语义上为空的草稿也可以提供大量的结构支架,而薄弱的草稿内容可能是有害的。最后,角色反转实验表明,强草稿显然有利于弱审稿人。最终,我们的研究结果表明,多 LLM 修订的效用受到任务结构和草稿质量的动态瓶颈,需要更有针对性的管道设计,而不是一揽子修订策略。