论文

测试框架感知的自演化:模型权重、测试框架与任务解共同演化

Harness-Aware Self-Evolving: Co-Evolving Model Weights, Harness, and Task Solutions

模型训练智能体系统强化学习Agent Harness智能体自我改进Agentic RL

摘要

自演化框架通常在将周围测试框架(harness)视为固定的同时优化任务解。我们引入测试框架感知自演化(HASE)——智能体强化学习框架:单一模型可在多轮动作空间中生成任务解或编辑选定的测试框架组件。HASE使单一Qwen3-8B模型匹敌使用Claude Code作为测试框架提议者的GPT-OSS-120B模型的文本分类性能。在alpha因子挖掘中——HASE超越已报告的GPT-OSS-120B基线。HASE还修复不完善的评估组件——并在圆装填算法发现中收敛到最先进性能。这些结果表明HASE经一个统一的智能体过程同时改进测试框架与解。