论文
SIA:通过脚手架与权重更新实现自我改进的AI
SIA: Self Improving AI with Harness & Weight Updates
摘要
人类是构建和改进人工智能的瓶颈。模型和包装它们的代理都是由人们编写、调整和纠正的。能够找出如何改进自身的人工智能的长期目标仍然是开放的。两条基本不相交的研究路线解决了这个瓶颈。线束更新学派有一个元代理重写了特定于任务的代理的支架(其工具、提示、重试逻辑和搜索过程),同时模型权重保持固定。测试时培训学校使用手写的 RL 管道来更新模型自身的任务反馈权重,同时安全带保持固定。这两个孤岛独立运作。我们提出了 SIA,这是一个自我改进的循环,其中语言模型代理(反馈代理)更新特定任务代理的工具和权重。我们评估了三个对比领域:中国法律指控分类、低级 GPU 内核优化和单细胞 RNA 去噪。在所有三个基准上,结合这两个杠杆优于单独使用支架迭代。与初始基线相比,LawBench 的增益为 56.6%,GPU 内核的运行时间减少了 91.9%,降噪效果为 502%。控制更新使模型具有代理性,塑造其搜索和行为方式,而权重更新构建了任何提示或脚手架都无法灌输的领域直觉。
