论文

Deep Researcher Agent:具备零成本监控、支持全天候深度学习实验的自主框架

Deep Researcher Agent: An Autonomous Framework for 24/7 Deep Learning Experimentation with Zero-Cost Monitoring

智能体系统上下文与知识记忆Agent HarnessAgent记忆Agent Runtime

摘要

我们提出Deep Researcher Agent,一个开源框架,使大语言模型(LLM)智能体能够全天候自主开展深度学习实验。与聚焦论文写作或代码生成的现有AI科研助手不同,我们的系统覆盖完整实验生命周期:假设形成、代码实现、训练执行、结果分析与迭代精炼。该框架引入三项关键创新:(1) 零成本监控——一种在模型训练期间仅依靠进程级检查和日志文件读取、不产生任何LLM API成本的监控范式;(2) 两层恒定大小记忆——无论运行时长多久均封顶约5K字符的记忆架构,避免长期运行智能体饱受的上下文无界增长;(3) 最小工具集领导者-工作者架构——每个工作者智能体仅配备3至5个工具的多智能体设计,将每次调用的token开销最多降低73%。在持续超过30天的部署中,该框架在四个并行研究项目上自主完成了500多个实验周期,其中一个项目通过200多次自动化实验使基线指标提升52%——全部的LLM平均成本仅为每24小时周期0.08美元。代码见 https://github.com/Xiangyue-Zhang/auto-deep-researcher-24x7。

Deep Researcher Agent:具备零成本监控、支持全天候深度学习实验的自主框架:论文配图
图 1:Deep Researcher Agent 概述。该系统作为连续的 Think→\rightarrowExecute→\rightarrowReflect 循环运行。在执行阶段,训练以零 LLM 成本进行监控——仅执行操作系统级别的进程检查和日志文件读取。无论代理运行多长时间,两层内存系统都会保持恒定的大小(∼\sim5K 字符)。