Mingbird:本地优先Agent工具,使小型开放模型能够完成实际任务
Mingbird: A Local-First Agent Harness Enabling Small Open Models to Complete Real Tasks
摘要
小型开放权重模型(2-9B)在普通笔记本电脑上运行,但在云规模Agent利用下,它们很少完成真正的任务:工具预填充溢出上下文,自我纠正发散,工具演示循环,任务被默默放弃。我们通过受控的单机比较和一个第三方基准提供证据,表明这些故障的很大一部分可归因于Harness而不是模型。我们介绍 Mingbird,一个适用于 Windows 和 Ollama 的本地优先Agent工具,其十种机制逐点补偿小模型故障形式,其中三个具有代表性:字节级净零预填充预算、在接受完成之前重新读取任务的完成门以及签名级循环检测。在 LRAB(受控比较持有机、模型、预算和固定评分)上(4 个工具 $\times$ 4 个开放模型 (2B-35B) $\times$ 18 个真实任务,确定性工件评分),Mingbird 总体达到 0.886,而 0.631(鹅)、0.479(开放代码)和 0.405(Agent迷你), 288 个细胞已发表;在 $τ^2$ 基准(278 个任务、三个分支、一个协议)上,总计为 0.856,对比 0.791 和 0.737;而针对相同 18 项任务的前沿模型探针跨Harness跨度为 0.997 到 0.478,结构良好的支架彼此之间的间距保持在 0.072 以内。留一机制消融被报告为仅定向的:同一臂的当晚复制将其平均值移动最多 0.069,即每个名义单试验增量的大小,并且一次批量匹配的比较(完整机制堆栈与单独的文本重新读取)为可执行完成防护在三个复制中提供了配对的 +0.10。证据具有明确的局限性:自建基准、单台机器和单次试验评分。