论文

HERA:Harness-环境共同进化,实现可靠的Agentic弃权

HERA: Harness-Environment Co-Evolution for Reliable Agentic Abstention

智能体系统Agent任务评测智能体自我改进长程任务评测

摘要

大语言模型 (LLM) 智能体在复杂的工具使用环境中的行动能力越来越强,但它们常常无法识别任务何时不可行且不存在有效的解决方案。最近的工作已将这种可靠性差距形式化为Agentic弃权问题,现有方法通常针对一组固定的任务优化模型或智能体Harness,从而导致对看不见的故障模式的泛化有限。我们介绍 HERA,一个针对Agentic弃权的Harness环境共同进化的框架。 HERA 包含 (i) 一个管道,通过应用受控环境突变来自动构建可验证的可行和不可行任务对,将可解决的任务转换为需要弃权的情况,以及 (ii) 一个共同进化过程,其中先前任务的性能失败用于驱动Harness适应并生成针对先前弱点的新执行环境和任务。在留出评估任务上,HERA 改进的Harness将弃权准确率从 61.7% 提高到 83.3%,同时将可行任务完成率从 68.3% 提高到 76.7%,在比较方法中实现了最高的弃权率和可行任务完成率。由此产生的最佳Harness可以在其他 19 个LLM上进行传输,在没有任何特定于模型的优化的情况下,弃权准确率平均提高了 15.3 个百分点,并且使较小的模型能够与更强大的模型的性能相匹配,而成本预计降低 85%。

HERA:Harness-环境共同进化,实现可靠的Agentic弃权的原论文方法或结果图
图 5:端到端环境 - 任务构建管道。该管道由三个阶段组成:环境构建、任务生成和环境突变。