论文

Terminus-4B:更小的模型能在智能体执行任务上替代前沿LLM吗?

Terminus-4B: Can a Smaller Model Replace Frontier LLMs at Agentic Execution Tasks?

模型优化模型训练强化学习小模型/轻量模型Agentic RL

摘要

现代编码智能体日益把专门子任务委托给子智能体——更小、更聚焦的智能体循环,负责搜索、调试或终端执行等狭窄职责。这一架构模式通过把冗长输出(构建日志、测试结果等)隔离在子智能体上下文中,保持主智能体上下文窗口干净。当智能体使用子智能体时,通常以前沿模型充当子智能体。本文研究经微调的小语言模型(SLM)能否在智能体终端执行任务上达到与前沿模型相当的性能。我们提出Terminus-4B:以基于量规的LLM-as-judge奖励,经SFT与RL后训练的Qwen3-4B,专为该任务。在我们横跨多个前沿模型、训练消融与主智能体配置的广泛评估中,Terminus-4B较无子智能体基线把主智能体的token用量最多降低约30%,且不影响其在SWE-Bench Pro与内部SWE-Bench C#(冗长执行任务偏重)等基准上的表现。Terminus-4B还改善了主智能体依赖子智能体输出、减少亲自执行终端任务的关键指标。我们的模型不仅弥合了原生Qwen与Claude Sonnet/Opus/GPT-5.3-Codex等前沿模型的差距,还常常超越其性能。

Terminus-4B:更小的模型能在智能体执行任务上替代前沿LLM吗?:论文配图
图 1. 对比 Serilog 存储库中实际问题的代理轨迹(使用和不使用执行子代理)。如果没有子代理(顶部),主代理必须直接调用终端命令,处理详细的构建和测试输出,并花费额外的轮次来解释结果,从而消耗更多的令牌和轮次。通过我们的子代理(底部),终端执行任务被委托给子代理,子代理吸收原始输出,并以预定义格式以简洁的最终答案仅返回关键发现。主代理永远不必处理详细的终端输出,从而保留其上下文窗口。