论文

SIA:通过脚手架与权重更新实现自我改进的AI

SIA: Self Improving AI with Harness & Weight Updates

智能体系统模型训练强化学习Agent Harness智能体自我改进Agentic RL

摘要

人类是构建和改进人工智能的瓶颈。模型和包装它们的代理都是由人们编写、调整和纠正的。能够找出如何改进自身的人工智能的长期目标仍然是开放的。两条基本不相交的研究路线解决了这个瓶颈。线束更新学派有一个元代理重写了特定于任务的代理的支架(其工具、提示、重试逻辑和搜索过程),同时模型权重保持固定。测试时培训学校使用手写的 RL 管道来更新模型自身的任务反馈权重,同时安全带保持固定。这两个孤岛独立运作。我们提出了 SIA,这是一个自我改进的循环,其中语言模型代理(反馈代理)更新特定任务代理的工具和权重。我们评估了三个对比领域:中国法律指控分类、低级 GPU 内核优化和单细胞 RNA 去噪。在所有三个基准上,结合这两个杠杆优于单独使用支架迭代。与初始基线相比,LawBench 的增益为 56.6%,GPU 内核的运行时间减少了 91.9%,降噪效果为 502%。控制更新使模型具有代理性,塑造其搜索和行为方式,而权重更新构建了任何提示或脚手架都无法灌输的领域直觉。

SIA:通过脚手架与权重更新实现自我改进的AI
图 1:跨三个不同任务的 SIA。每个面板比较三个操作点:LawBench Top-1 精度、TriMul CUDA 加速和 scRNA-seq 去噪 mse_norm 的基线(第一代,无 SIA)、SIA-H(仅线束更新)和 SIA-W+H(线束 + 权重更新)。虚线标记了之前的最新技术。 SIA-W+H 在所有三项任务上都严格优于 SIA-H。