论文

DecoEvo:文本空间中求解器与评分准则生成器技能的分数解耦协同进化

DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space

上下文与知识智能体系统上下文工程Agent Skills

摘要

文本空间优化通过编辑外部自然语言工件而非模型权重来适配大语言模型(LLM),因此被优化的工件保持可检查,模型可被视为黑盒。然而,大多数现有文本空间方法保持评估固定不变。在开放式任务上,这可能成为瓶颈:一旦求解器在评分准则所测标准上改进,被遗漏的维度对优化信号仍不可见。当更新由当前求解器的分数来筛选时,单纯让准则进化也不可靠,因为表面上的进步可能来自把准则变得更易满足。我们提出DecoEvo(Decoupled Co-Evolution),它在解耦目标下协同进化求解器技能与评分准则生成器技能,且优化过程中不使用标准评分准则。求解器技能依据标准级反馈更新,而评分准则生成器技能通过与总体求解器分数无关的需求覆盖与响应区分这两项互补审计来修订。这种分离使生成器更新聚焦于新暴露的求解器弱点,减少对求解器已满足标准的重复强调。在各基准的官方评估下,DecoEvo在五个基准与三个LLM骨干上超越所有对比方法,在五基准平均上相对SkillOpt取得2.8–5.0%的相对增益。

DecoEvo:文本空间中求解器与评分准则生成器技能的分数解耦协同进化:论文配图
图 1:基于评分标准的技能优化的三种范例。 (a) 静态规则可能会成为求解器演化的瓶颈。 (b) 分数耦合共同进化通过总分数选择两种技能的更新,从而冒着向求解器漂移的风险。 (c) DecoEvo 通过任务条件结构和近平对比审计将生成器更新与求解器总分解耦。