论文

衡量微任务资格差距:现成的 SLM 何时足以用于AgentHarness?

Measuring the Microtask Eligibility Gap: When Is an Off-the-Shelf SLM Enough for an Agent Harness?

模型评测评测方法与指标

摘要

Agent越来越希望在围绕前沿大语言模型 (LLM) 规划器的微任务上运行小语言模型 (SLM):自动批准 shell 命令、写入内存、选择工具、对过去的轮次进行排名。我们询问现成的 SLM 是否满足从业者定义的阈值,当它们失败时,为什么会失败,以及量化是否会改变答案。我们构建了 4 个具有固定提示和自动指标的此类微任务的基准,每个微任务都有一个预先指定的阈值 $τ$,锚定到廉价的非 LLM 基线和 CI 感知资格规则(只有当其置信界限清除 $τ$ 时,配置才能通过)。横扫 Qwen3 0.6/1.7/4/8B 的最佳状态(FP16、贪婪、一个冻结提示、无调整),我们发现了一个资格差距:16 项中的 0 项(4 个任务 $\times$ 4 个模型)配置通过(通过检查原始输出和解析器行为进行验证)。 logprob 决策阈值诊断(T1/T3/T4;通过上下文长度/级联探测的 T2)将故障分为能力缺陷和可以通过更改解码阈值(4 个方案)来解决的故障。量化到 4 位 (RTN/GPTQ/AWQ) 会造成损害,具体取决于模型大小,并且不会将任何配置移至资格(在可重构硬标签任务 T1/T3 上进行认证,在 T2/T4 上进行诊断/窗口鲁棒性),因此差距更多地跟踪模型大小而不是精度;它在 Llama-3.x 上复制(12/12 不合格),并且对于锚点选择($τ$ 扫描)和提示措辞(0/112 合格整个原始加上每个单元格 3 个中性释义)具有鲁棒性。实际含义:将 SLM 置于满足 CI 支持阈值的基线之后,并且仅在基线无法满足阈值时使用 SLM;例如BM25 入围名单上的 4B 重新排名者击败 BM25($+0.047$ [0.020, 0.073],无需自身证明资格)。