论文
自我进化的LLM系统什么时候才够用?
When Is Enough Enough in Self-Evolving LLM Systems?
摘要
自我进化的大语言模型 (LLM) 系统反复提出、评估和合并对提示、技能或其他持久工件的更新。尽管它们的有效性不断提高,但这些系统通常在预定的迭代或计算预算下运行,没有原则性标准来确定何时不再值得进一步发展。这可能会导致两个不良后果:性能饱和后进行不必要的计算,以及返回过度拟合或利用评估信号的最新更新的风险。这些问题促使我们研究两个基本问题:一个自进化系统什么时候应该停止,一旦停止它应该输出什么?我们通过制定在线顺序测试问题并使用自我进化的LLM系统已经产生的每项配对评估结果构建随时有效的重启检测器来解决第一个问题。我们通过制定变点估计问题并使用估计的转变来选择较早的工件进行输出来解决第二个问题。由此产生的过程是即插即用的,不需要修改底层的自我进化算法。在两个自我进化框架、三个LLM模型系列和五个基准测试中,我们的方法大大降低了计算成本,同时保持了可比较的未见过的测试性能。例如,在使用 SkillOpt 和 DeepSeek V4 Flash 的 SearchQA 上,我们的方法停止在第 4 轮而不是 40 的完整预算,将token使用率减少了 91.6%,同时实现了 82.43% 的未见测试准确度,而在完整预算运行下为 82.00%。
