论文

ScienceClaw:跨学科科学 Agent 持续自演化基准

ScienceClaw: Benchmarking Continual Self-Evolution of AI-for-Science Agents Across the Natural and Social Sciences

智能体系统Agent任务评测Agent Skills智能体自我改进长程任务评测

摘要

语言模型Agent加速科学自动化,但验证成功的执行很少转化为持久程序级改进,现有评测也未在自然与社会科学连续任务中考察过程。ScienceClaw将其形式化为固定模型参数下的程序自演化,统一解题、科学验证和程序更新。ScienceClaw-Eval覆盖23学科,借连续任务流与独立重置评测衡量科学正确性、演化收益、能力保持、跨数据集迁移和成本。框架多轮修复可执行流程,把重新执行验证的失败—成功轨迹转成关联Skill与Operator候选;仅当源任务重放复现修复且独立科学任务改善时才保留更新。代码位于 https://github.com/beita6969/ScienceClaw。

ScienceClaw:跨学科科学 Agent 持续自演化基准:论文原图
图1:科学Agent可验证程序级自演化的任务定义。科学任务与领域约束组成连续任务流。ScienceClaw采用固定基础模型、可编辑Skills与类型化Operators构建可执行流程,并按源任务重放、独立验证、迁移、保持和成本评价修复。