论文

ReThinker:以引导式反思与置信度控制进行重思的科学推理

ReThinker: Scientific Reasoning by Rethinking with Guided Reflection and Confidence Control

智能体系统Agent 架构与控制循环

摘要

对大语言模型而言,专家级科学推理仍然困难,尤其在Humanity's Last Exam(HLE)等基准上,僵化的工具流水线、脆弱的多智能体协调与低效的测试时扩展常常限制表现。我们提出ReThinker,一个置信度感知的Agentic框架,经由分阶段的Solver-Critic-Selector架构编排检索、工具使用与多智能体推理。ReThinker不遵循固定流水线,而是基于模型置信度动态分配计算,实现自适应的工具调用、引导式的多维反思与鲁棒的置信度加权选择。为支持无需人工标注的可扩展训练,我们进一步提出反向数据合成流水线与自适应轨迹回收策略,把成功的推理轨迹转化为高质量监督。在HLE、GAIA与XBench上的实验表明,ReThinker持续超越配合工具的最先进基础模型与现有深度研究系统,在专家级推理任务上取得最先进结果。

ReThinker:以引导式反思与置信度控制进行重思的科学推理
图2:ReThinker的总体框架:一个面向专家级科学推理的数据驱动、不确定性引导的Agentic系统。该框架包含三个相互整合的阶段:(A) Post-Training Data Synthesis & Curation,其中轨迹回收与验证agent通过正确性检查、格式化、去重和质量均衡来生成并完善专家QA对;(B) Multi-Path Iterative Reasoning,其中并行的Solver-Critic路径执行工具增强的推理,从用户查询中产生候选轨迹;(C) Confidence-Guided Selection,一个三阶段过程,采用Latin Square Permutation Test进行初步判断、基于历史数据和困惑度分数(PPLs)进行迭代重选、并通过全票投票做出最终决定。该系统具有双重反馈回路——Data Recycling Flow与Iterative Bootstrapping Flow——可持续增强知识基础和推理能力。