论文

三个角色,一个模型:以推理时角色编排缩小小型与大型智能体的性能差距

Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents

智能体系统上下文与知识上下文工程Agent Harness

摘要

大语言模型 (LLM) 代理在实际的工具使用任务中显示出前景,但在适度的硬件上部署功能强大的代理仍然具有挑战性。我们研究在没有任何额外训练计算的情况下,单独的推理时间支架是否可以提高复杂多步骤环境中小型模型的性能。我们在单个 24 GB GPU 上运行,在全精度(FP16,12K 上下文)和 4 位量化(AWQ,32K 上下文)配置下评估 Qwen3-8B。在没有任何干预的情况下,原始模型仅实现 5.4\% (FP16) 和 3.0\% (AWQ) 任务目标完成率。在系统故障模式分析的指导下,我们引入了一个三层推理脚手架管道,该管道在三个不同的角色中部署相同的冻结模型:(1)在压缩对话历史记录的同时保留关键工件(token、凭证、API 响应)的摘要模型; (2)对压缩上下文进行推理的主代理模型; (3) 一个独立的纠正模型,可以在不访问对话历史记录的情况下检查和修改代理的代码输出,从而打破重复的故障循环。应用于相同的未修改模型,该脚手架可实现 8.9\% (FP16) 和 5.9\% (AWQ) 任务目标完成率,两种设置下的性能大约翻倍,尤其是在难度 1 的任务上获得特别强劲的收益(15.8\%$\to$26.3\% FP16;5.3\%$\to$14.0\% AWQ)。在全精度推理方面,我们的脚手架 8B 模型超越了原始 AppWorld 评估中的 DeepSeek-Coder 33B Instruct (7.1\%),这表明结构化推理时间干预可以使小型模型与规模为 4 倍的系统竞争。我们将该方法形式化为冻结基础模型上的脚手架策略,在不同条件下对相同权重进行三次调用,与强化学习中的测试时计算缩放和动作空间塑造建立联系。

三个角色,一个模型:以推理时角色编排缩小小型与大型智能体的性能差距
图 1:我们提出的模块化架构。每个模块都针对小语言模型的重要故障模式,以提高性能。