论文
Praxist:从实验产物到可追溯的方案演化谱系
Praxist: From Experimental Artifacts to Solution Lineages
摘要
自主研发代理现在在自动评估下编写、运行和改进可执行工件——但主要是作为实验室仪器:在策划的基准上显示,其收益很难追踪到原因,而且成本远高于持续工程实践所吸收的成本。这种限制是结构性的。大多数系统将每次尝试视为几乎独立的,因此日志、内存和搜索树会记录发生的情况,而不会确定哪个设计元素产生了改进,其证据是否经过验证,或者它如何与其他元素重新组合。因此,长期的竞选活动不断地重新吸取同样的教训。我们引入了 Praxist,一个以谱系为中心的代系统,它将可重复的工件和评估结果转换为发现结果、车道结构边界和议程的类型化证据图。将本地工件构建与队列级别证据合成分开,可以让以后的尝试继承经过验证的机制、未解决的声明和有用的约束,并将结果附加到可检查的谱系。在标准化的 75 项 MLE 基准套件上,最终的官方评分结果为 Praxist 提供了 60 枚奖牌 (80.0\%),其中 49 枚金牌,而 Claude Opus 4.8 上的 Claude Code 基准则获得 55 枚奖牌 (73.3\%) 和 34 枚金牌——记录的模型支出为 3,054 美元,对比 38,370 美元,大约是成本。四个案例研究——定量交易、激光雷达惯性视觉 SLAM、托卡马克磁控制和火箭着陆——将相同的过程引入开放式工程问题中,在标题准确性、生存或资源成本方面改进每个任务的原生基线,并记录发现路径。据我们所知,花费少一个数量级的更强大的工件,每一个都由可审计的血统支持,首先聚集在这里:生产研究所需的操作配置文件,而不是基准演示建立的操作配置文件。