论文
在测试时 AI4AI 中学习AgentHarness设计的元技能
Learning Meta-Skills for Agent Harness Design in Test-Time AI4AI
摘要
Agent的性能取决于推理能力和其行为的环境。我们研究测试时的 AI-for-AI,询问构建器如何学习为目标构建更好的执行环境,同时两个模型的权重保持固定。为了使构建者的经验可重用,我们引入了元技能:指定何时需要支持以及提供哪些资源的原则。构建者从 Target 对开发集的执行反馈中学习这些原则,然后使用冻结的技能库来构建用于看不见的任务的工具。在 Harness-Bench 和 NewtonBench 中,全银行元技能比无技能建设提高了宏观平均绩效 8.95 个百分点,比直接向目标交付同一银行提高了 12.02 个百分点。这些结果凸显了将经验转化为可执行支持的价值。当同一个模型同时扮演两个角色时所获得的收益进一步表明了通过学习构建更好的环境来实现系统级自我改进的途径。