论文
OpenAI4S:代码作为操作,科学作为会话
OpenAI4S: Code as Action, Science as Sessions
摘要
AI协同科学家可以加速计算研究,但长期研究中工作流必须保持可检查、可恢复和可重现,这需要持久的计算状态和溯源信息。本文提出OpenAI4S,这是一个基于‘代码作为操作,科学作为会话’原则的开源科研智能体。OpenAI4S结合了持久计算运行时与研究会话管理:通过结构化的工具调用实现工作流编排,科学操作以完整代码单元的形式在持久的Python和R内核中执行。一个只追加的行动日志、每单元执行记录、版本化成果、环境记录和工作区快照,保留了结果生成过程,支持会话恢复、分支和扩展。可配置的沙箱、权限控制以及代码和轨迹审查提供互补的安全保障。我们在36个科研场景中评估了OpenAI4S,涵盖 retrosynthesis(逆合成)、分子动力学、蛋白结合设计、蛋白突变、催化剂筛选和矿物光谱等领域,测量了科学任务准确率、工作流完整性和生成仓库的可重现性。OpenAI4S整体得分为7.83,优于使用三个前沿模型评估的通用编码工具(得分5.7至6.4),在长周期和计算密集型工作流中表现提升最显著。结果表明,将持久执行与会话级溯源结合,可提升AI辅助科研工作流的可靠性。然而,环境配置和完整可重跑能力在所有评估系统中(包括本系统)仍存在不足,因此科研智能体的可重现性仍是开放问题。该系统以MIT许可证开源,地址为 this http URL。
