论文

KARL:基于强化学习的知识Agent

KARL: Knowledge Agents via Reinforcement Learning

模型训练强化学习Agentic RL

摘要

我们提出一个通过强化学习训练企业搜索Agent的系统,在一套多样的难以验证的Agentic搜索任务上取得最先进性能。我们的工作有四项核心贡献。第一,我们引入KARLBench,一个跨越六种不同搜索模式的多能力评估套件,包括约束驱动的实体搜索、跨文档报告综合、表格数值推理、穷举实体检索、技术文档的程序化推理以及企业内部笔记的事实聚合。第二,我们表明在异构搜索行为上训练的模型比针对任何单一基准优化的模型泛化能力显著更强。第三,我们开发了一个Agentic合成流水线,利用长程推理和工具使用生成多样、有证据依据且高质量的训练数据,并从不断增强的模型中进行迭代自举。第四,我们提出一种基于迭代大批量off-policy RL的新后训练范式,它样本高效、对训练-推理引擎差异鲁棒,并自然扩展到具有分布外泛化能力的多任务训练。与Claude 4.6和GPT 5.2相比,KARL在KARLBench上的成本-质量与延迟-质量权衡上呈Pareto最优,包括训练期间分布外的任务。在充足的测试时算力下,它超越了最强的闭源模型。这些结果表明,定制的合成数据结合多任务强化学习能够打造高性价比、高性能的知识Agent,实现基于证据的推理。

KARL:基于强化学习的知识Agent
图1:KARL在使用与不使用测试时算力的情况下,与最先进智能体模型在KARLBench上的性能比较。成本–质量与延迟–质量帕累托前沿显示,KARL相比现有模型取得了更优的权衡。在更具成本与延迟效益的同时,KARL以三个并行rollout超越了Sonnet 4.6的质量,并以十个并行rollout匹敌最佳模型Opus 4.6。实验细节见附录B。