论文

让冻结LLM智能体学习一个领域的控制系统、数据集与部署方案

A Control System, a Dataset, and a Recipe for Making Frozen LLM Agents Learn a Domain

智能体系统模型训练强化学习Agent Harness智能体自我改进Agentic RL

摘要

生产级LLM智能体越来越多地由冻结模型包裹在Harness中组装而成:包括提示模板、工具集、记忆/检索层、规划策略和验证策略。2026年的两个系统Meta-Harness(Lee等人,2026)与HyperAgents(Meta AI,2026)表明,Harness本身可以被优化甚至由智能体提案者自我重写——但代价是要么经历昂贵的代码搜索循环,要么采用不受约束的自修改代码,两者都不可审计,也无法用于完全黑盒的模型API。我们采取更窄、更受约束的立场:将Harness视为一个小型、固定、人类可读的动作空间,并用经典的样本高效强化学习($ε$-贪心上下文老虎机与REINFORCE)在其上在线学习策略,以多目标奖励打分(任务成功、验证器得分、政策合规、成本、延迟以及无依据声明惩罚)。我们用DSPy(Khattab等人,2024)实例化该控制系统:DSPy既充当上下文组装器,又提供最强的非自适应基线(DSPy BootstrapFewShot静态提示);我们在三个可验证任务领域——工具使用工作流、代码生成(HumanEval)与多跳检索问答(HotpotQA)——以及两个模型提供商(本地Ollama模型与AWS Bedrock)上进行评估。我们发布Harness控制系统代码、跨领域可验证任务套件、训练全程的轨迹/奖励分解日志,以及可应用于新组织领域与验证设置的、与提供商无关的部署方案。

让冻结LLM智能体学习一个领域的控制系统、数据集与部署方案:论文配图
图 1:优化器、主矩阵的可靠性与成本(每集平均词元)。