论文
ScienceClaw:跨学科科学 Agent 持续自演化基准
ScienceClaw: Benchmarking Continual Self-Evolution of AI-for-Science Agents Across the Natural and Social Sciences
摘要
语言模型Agent加速科学自动化,但验证成功的执行很少转化为持久程序级改进,现有评测也未在自然与社会科学连续任务中考察过程。ScienceClaw将其形式化为固定模型参数下的程序自演化,统一解题、科学验证和程序更新。ScienceClaw-Eval覆盖23学科,借连续任务流与独立重置评测衡量科学正确性、演化收益、能力保持、跨数据集迁移和成本。框架多轮修复可执行流程,把重新执行验证的失败—成功轨迹转成关联Skill与Operator候选;仅当源任务重放复现修复且独立科学任务改善时才保留更新。代码位于 https://github.com/beita6969/ScienceClaw。
