论文
SciOrch:学习编排专家 LLM 来解决前沿多模态科学推理任务
SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks
摘要
前沿科学推理仍然是 大语言模型 (LLM) 的主要挑战,即使是最强大的商业系统也达不到专家级的性能。仔细观察模型行为可以发现单一模型评估所隐藏的实质性互补性:不同的前沿模型在不同的问题类型上表现出色,并且没有一个模型能够捕捉到全局。我们推出了 SciOrch,这是一个训练轻量级 8B 模型的框架,用于协调科学推理的前沿 LLM。编排器分解每个问题,通过 API 调用将子问题委托给选定的商业模型,并综合最终答案。训练这样的编排器从根本上来说比传统的代理强化学习更加困难:每个操作都会触发一个 API 调用,这在成本和延迟方面都很昂贵,使得标准在线轨迹采样变得不可行。我们使用基于 MCTS 的方法来解决这个问题,生成不同的编排轨迹,提取每个节点的单轮样本,并通过 GRPO 式训练优化编排器。在涵盖 SGI 推理和科学家第一次考试的 240 个问题测试集上,SciOrch 的平均准确率达到 56.66%,比最强的单一商业模型高出 3.74%,比最强的多智能体基线高出 3.33%。它还在 SGI 和 SFE 上获得了最佳精度,而 API 成本不到典型多代理方法的一半。