论文

Meta-Harness:模型外围框架的端到端优化

Meta-Harness: End-to-End Optimization of Model Harnesses

智能体系统上下文与知识上下文工程Agent Harness智能体自我改进

摘要

大语言模型(LLM)系统的性能不仅取决于模型权重,还取决于其外围框架(harness):即决定存储什么信息、检索什么信息以及向模型呈现什么信息的代码。然而,外围框架目前仍在很大程度上依赖手工设计,而现有文本优化器与这一场景并不匹配,因为它们过于激进地压缩反馈。我们提出Meta-Harness,一个在LLM应用的外围框架代码上进行搜索的外循环系统。它使用一个智能体式提议器,通过文件系统访问所有先前候选的源代码、评分与执行轨迹。在在线文本分类上,Meta-Harness比最先进的上下文管理系统提升7.7分,同时上下文token用量减少4倍。在检索增强的数学推理上,一个自动发现的外围框架在200道IMO难度问题上,跨五个留出模型平均提升准确率4.7分。在智能体编程上,自动发现的外围框架在TerminalBench-2上超越最佳手工工程化基线。综合来看,这些结果表明,对先前经验更充分的访问能够实现自动化的外围框架工程。

Meta-Harness:模型外围框架的端到端优化:论文配图
图 2:Meta-Harness 搜索循环。 (1) 代理读取包含所有先前候选人的源代码、执行跟踪和分数的文件系统,并提出新的工具。 (2) 我们评估了评估任务中提出的工具。 (3) 所有日志(建议的代码、推理轨迹、评估分数)都存储在文件系统中的新目录中,并重复循环。