论文
ReThinker:以引导式反思与置信度控制进行重思的科学推理
ReThinker: Scientific Reasoning by Rethinking with Guided Reflection and Confidence Control
摘要
对大语言模型而言,专家级科学推理仍然困难,尤其在Humanity's Last Exam(HLE)等基准上,僵化的工具流水线、脆弱的多智能体协调与低效的测试时扩展常常限制表现。我们提出ReThinker,一个置信度感知的Agentic框架,经由分阶段的Solver-Critic-Selector架构编排检索、工具使用与多智能体推理。ReThinker不遵循固定流水线,而是基于模型置信度动态分配计算,实现自适应的工具调用、引导式的多维反思与鲁棒的置信度加权选择。为支持无需人工标注的可扩展训练,我们进一步提出反向数据合成流水线与自适应轨迹回收策略,把成功的推理轨迹转化为高质量监督。在HLE、GAIA与XBench上的实验表明,ReThinker持续超越配合工具的最先进基础模型与现有深度研究系统,在专家级推理任务上取得最先进结果。
