论文
Terminus-4B:更小的模型能在智能体执行任务上替代前沿LLM吗?
Terminus-4B: Can a Smaller Model Replace Frontier LLMs at Agentic Execution Tasks?
摘要
现代编码智能体日益把专门子任务委托给子智能体——更小、更聚焦的智能体循环,负责搜索、调试或终端执行等狭窄职责。这一架构模式通过把冗长输出(构建日志、测试结果等)隔离在子智能体上下文中,保持主智能体上下文窗口干净。当智能体使用子智能体时,通常以前沿模型充当子智能体。本文研究经微调的小语言模型(SLM)能否在智能体终端执行任务上达到与前沿模型相当的性能。我们提出Terminus-4B:以基于量规的LLM-as-judge奖励,经SFT与RL后训练的Qwen3-4B,专为该任务。在我们横跨多个前沿模型、训练消融与主智能体配置的广泛评估中,Terminus-4B较无子智能体基线把主智能体的token用量最多降低约30%,且不影响其在SWE-Bench Pro与内部SWE-Bench C#(冗长执行任务偏重)等基准上的表现。Terminus-4B还改善了主智能体依赖子智能体输出、减少亲自执行终端任务的关键指标。我们的模型不仅弥合了原生Qwen与Claude Sonnet/Opus/GPT-5.3-Codex等前沿模型的差距,还常常超越其性能。
