论文

大小不重要:Harness设计决定小语言模型的运行稳定性

It's Not the Size: Harness Design Determines Operational Stability in Small Language Models

智能体系统Agent Harness

摘要

本文通过实验分析了Harness工程水平如何影响小语言模型(SLM、2-3B参数)的运行性能。三个Harness条件 - 仅模型(原始提示)、最小外壳(包装标签)和 4 阶段管道(计划->执行->验证->恢复) - 应用于 24 个任务中的三个模型(Gemma4 E2B、Qwen3.5:2B、LLaMA 3.2 3B),比较任务成功率 (TSR) 和有效 TSR (VTSR)。该管道Harness在 Gemma4 E2B(T1-T5,21 个任务)上实现了 TSR=0.952 和 VTSR=1.000。在两个模型中观察到非单调现象 - 最小壳 TSR < 仅模型 TSR。在仅 LLaMA 3.2 3B 模型中,七种格式违规导致 TSR=0.429,揭示了脚手架崩溃:模型在没有Harness支持的情况下放弃了复杂格式要求下的 JSON 结构。消融显示计划和恢复各贡献约 24.7% 的总增益。所有管道运行中的 VCR(验证捕获率)=0.625。