论文

OpenAI4S:代码作为操作,科学作为会话

OpenAI4S: Code as Action, Science as Sessions

智能体系统AI 基础设施Agent HarnessSandboxAgent RuntimeAgent Sandbox

摘要

AI协同科学家可以加速计算研究,但长期研究中工作流必须保持可检查、可恢复和可重现,这需要持久的计算状态和溯源信息。本文提出OpenAI4S,这是一个基于‘代码作为操作,科学作为会话’原则的开源科研智能体。OpenAI4S结合了持久计算运行时与研究会话管理:通过结构化的工具调用实现工作流编排,科学操作以完整代码单元的形式在持久的Python和R内核中执行。一个只追加的行动日志、每单元执行记录、版本化成果、环境记录和工作区快照,保留了结果生成过程,支持会话恢复、分支和扩展。可配置的沙箱、权限控制以及代码和轨迹审查提供互补的安全保障。我们在36个科研场景中评估了OpenAI4S,涵盖 retrosynthesis(逆合成)、分子动力学、蛋白结合设计、蛋白突变、催化剂筛选和矿物光谱等领域,测量了科学任务准确率、工作流完整性和生成仓库的可重现性。OpenAI4S整体得分为7.83,优于使用三个前沿模型评估的通用编码工具(得分5.7至6.4),在长周期和计算密集型工作流中表现提升最显著。结果表明,将持久执行与会话级溯源结合,可提升AI辅助科研工作流的可靠性。然而,环境配置和完整可重跑能力在所有评估系统中(包括本系统)仍存在不足,因此科研智能体的可重现性仍是开放问题。该系统以MIT许可证开源,地址为 this http URL。

OpenAI4S:代码作为操作,科学作为会话:论文配图
图 1:OpenAI4S 概述:代码即行动,科学即会话。 (A) 科学研究通过目标设定、数据采集、计算或模拟以及解释的重复循环进行,其中研究人员与人工智能联合科学家合作。 (B) OpenAI4S 协调两个动作通道。控制平面通过提供商本机工具调用来处理规划、编排、权限和监控。在科学运行时,模型编写在持久性 Python 和 R 内核中运行的完整代码单元,Python 单元可以在执行期间调用经过审计的主机服务。仅附加操作分类帐、版本化工件、环境记录和工作区检查点保持两个通道共享的会话状态,并支持在捕获状态的限制内进行检查、分支和恢复。可配置的沙箱、权限调解、筛选和审计日志记录可作为保障措施。 (C) 评估涵盖化学、生物学和材料科学六项任务的 36 个场景。图 2 和第 3 节给出了架构细节。