论文
实习生-S2-预览:科学代理基础模型
Intern-S2-Preview: Scientific Agentic Foundation Model
摘要
科学发现越来越需要人工智能系统能够对异构模式的科学证据进行推理,与科学工具和环境交互,并在长期任务范围内维持进展。我们推出了 Intern-S2-Preview,这是一系列科学代理基础模型,旨在支持多模式科学理解、推理、生成和长期任务。训练管道从科学多模态 预训练 开始,涵盖渲染的科学文档、交错的图像文本数据和不同的科学语料库。从预训练检查点开始,我们应用了统一的 后训练 管道,其中包括监督 微调、可扩展的多任务强化学习 (RL)、黑白盒代理 RL 和 同策略 蒸馏。该管道得到了提高轨迹采样和训练稳定性和效率的实用技术的支持,包括通过 离策略 校正进行部分轨迹采样、自适应长度正则化、在线 推测解码、强大的多任务优化以及用于代理任务的跟踪感知体验组装。在架构层面,Intern-S2-Preview-397B 将时间序列建模从高效的长序列理解扩展到数值预测,而内存解码器则被研究为一种单独的内存增强路径,用于快速科学专业化,而无需修改冻结的 397B 主干。对科学、多模式、代理和通用基准的评估表明,Intern-S2-Preview-397B 在多种设置中取得了具有竞争力或领先的结果。时间序列模块改进了 SciTS 上的科学信号理解和预测,而单独的 Intern-MemDec-4B 扩展将生物指令平均分数从 56.92 提高到 60.32,而无需修改冻结的 397B 主干。