论文

SoL-Pi:递归扩展自动研究循环以改进Agent Harness效率

SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness

智能体系统上下文与知识上下文工程Agent Harness智能体自我改进

摘要

随着编程智能体从受监督的代码补全转向无人值守、全天候探索,其工作由孤立预测扩展为推理、工具使用和反馈构成的长轨迹。Token效率因此对扩展递归自我改进非常重要。我们在Harness层采用受递归自我改进(RSI)启发的方法,在越来越多、越来越多样的环境中扩展用于Harness运行轨迹的自动研究循环。在这一规模下,流程产生了能够迁移到开发环境之外的可复用改进,推动自动Harness发现走向生产级结果。四项机制在筛选后保留下来并组成SoL-Pi,覆盖动作执行、上下文压缩、观测处理和委派阅读。在包含51个任务的EdgeBench评估中,SoL-Pi在GPT-5.6 Sol与Opus 5上取得与Pi相当的表现,同时将记录的Token流量减少44.7%—49.0%,API成本降低约三分之一。换算后,相比原生Codex和Claude Code Harness,估计每小时节省8.75—13.50美元;相比Pi,每小时节省4.36—5.71美元。

SoL-Pi:递归扩展自动研究循环以改进Agent Harness效率:论文配图
图1:SoL-Pi通过自动研究发现更节省Token的Harness。(a)基础Harness在预备研究环境执行任务,研究AI检查轨迹、提出改动,并通过能力及效率门槛筛选;保留四项机制,整合优化后冻结,再在未见基准评估。图中轨迹、想法及门控为示意,能力检查有固定容差,留出结果不回流搜索。(b)EdgeBench示例比较原生Codex、Claude Code、Pi及完整SoL-Pi的平均分与API成本;相对GPT-5.6 Sol上的Codex成本减少50.0%,相对Opus 5上的Claude Code减少54.3%。