论文

Agent Gym:通过人在回路反馈持续评估与演进LLM智能体的框架

Agent Gym: A Framework for Continuous Evaluation and Evolution of LLM Agents Through Human-in-the-Loop Feedback

智能体系统Agent Harness

摘要

部署在生产环境中的大语言模型(LLM)智能体面临一个根本矛盾:智能体的行为在部署时被冻结,而它必须应对的业务规则与边缘情况却在持续演变。现有方法解决智能体构建与一次性评估,但缺乏在不修改智能体源代码的情况下进行部署后持续行为矫正的结构化机制。市面上的多数方案要求高强度地收集日志与轨迹,并要求工程团队重新审视智能体设计,这一过程繁重、漫长,抵消了智能体化转型的经济价值。我们提出Agent Gym,一个模块化、领域无关的框架,将任何既有LLM智能体包裹进持续的评估-演进循环。该框架提供六项可组合能力——Act(行动)、Evaluate(评估)、Investigate(调查)、Correct(矫正)、Learn(学习)与Observe(观察)——组织在三个架构区中:将领域知识编入配置产物的宪法层、串联行动-调查-自适应矫正的运行时推理管线,以及让领域专家通过自然语言交互发现并验证新矫正规则的学习回路。关键技术贡献包括:带21个条件算子与三层动作的确定性-LLM混合矫正引擎、面向无真值合规验证的三层调查架构,以及保证规则在人工批准前正确性的程序化安全回路。我们还提出Spec-to-Note Gap,一种受自编码器启发的智能体系统透明度视角。面向发票处理的开源参考实现表明该框架完全可运行、可供采用。