论文

从程序技能到策略基因:迈向体验驱动的测试时进化

From Procedural Skills to Strategy Genes: Towards Experience-Driven Test-Time Evolution

智能体系统Agent Harness

摘要

这份测试版技术报告询问了如何表示可重用的体验,以便它可以作为有效的测试时间控制并作为迭代演进的基础。我们通过 45 个科学密码求解场景的 4.590 项对照试验研究了这个问题。我们发现面向文档的技能包提供了不稳定的控制:它们的有用信号稀疏,并且将紧凑的体验对象扩展为更完整的文档包通常无法提供帮助,并且可能会降低整体平均值。我们进一步表明,表征本身是一阶因素。紧凑的基因表示产生最强的总体平均值,在重大结构扰动下保持竞争力,并且优于匹配预算的技能片段,而重新附加面向文档的材料通常会削弱而不是改善它。除了一次性控制之外,我们还表明 Gene 也是迭代经验积累的更好载体:附加的故障历史记录在 Gene 中比在 Skill 或自由格式文本中更有效,可编辑的结构比单独的内容更重要,并且当故障信息被提炼成紧凑的警告而不是天真地附加时,它是最有用的。在 CritPt 上,基因进化系统比其配对基础模型从 9.1% 提高到 18.57%,从 17.7% 提高到 27.14%。这些结果表明,经验重用的核心问题不是如何提供更多经验,而是如何将经验编码为紧凑的、面向控制的、易于进化的对象。