论文
SoL-Pi:递归扩展自动研究循环以改进Agent Harness效率
SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness
摘要
随着编程智能体从受监督的代码补全转向无人值守、全天候探索,其工作由孤立预测扩展为推理、工具使用和反馈构成的长轨迹。Token效率因此对扩展递归自我改进非常重要。我们在Harness层采用受递归自我改进(RSI)启发的方法,在越来越多、越来越多样的环境中扩展用于Harness运行轨迹的自动研究循环。在这一规模下,流程产生了能够迁移到开发环境之外的可复用改进,推动自动Harness发现走向生产级结果。四项机制在筛选后保留下来并组成SoL-Pi,覆盖动作执行、上下文压缩、观测处理和委派阅读。在包含51个任务的EdgeBench评估中,SoL-Pi在GPT-5.6 Sol与Opus 5上取得与Pi相当的表现,同时将记录的Token流量减少44.7%—49.0%,API成本降低约三分之一。换算后,相比原生Codex和Claude Code Harness,估计每小时节省8.75—13.50美元;相比Pi,每小时节省4.36—5.71美元。
