论文

AgentFloor:小尺寸开源权重模型能沿工具使用阶梯攀升多远?

AgentFloor: How Far Up the tool use Ladder Can Small Open-Weight Models Go?

智能体系统Agent任务评测

摘要

生产环境的agentic系统在每次用户请求中发起多次模型调用,其中大多数调用短促、结构化且属于例行操作。这引出一个现有评估未直接回答的实用路由问题:agent工作流的哪些部分真正需要大型前沿智能,哪些可以交给更小的模型?我们提出AgentFloor,一个确定性的30任务基准,组织为六级能力阶梯,涵盖指令遵循、工具使用、多步协调以及持续约束下的长程规划。我们评估了16个开源权重模型(参数量从0.27B到32B),连同GPT-5,共执行16,542次计分运行。我们的结果揭示了清晰的模型必要性边界。小型和中型开源权重模型已足以胜任真实agent流水线中占主导的大量短程、结构化工具使用工作;总体而言,最强的开源权重模型在我们的基准上与GPT-5持平,同时运行成本显著更低、速度显著更快。差距在需要持续协调和跨多步可靠约束追踪的长程规划任务上最为明显,前沿模型仍具优势,尽管双方都未达到强可靠性。我们还发现这一边界无法单用规模解释:一些失败可通过针对性干预改善,但效果是模型特定的而非普适的。这些发现给出了agentic系统的实用设计原则:让更小的开源权重模型承担大范围的常规动作,把大型前沿模型留给真正需要更深层规划与控制的较窄任务类别。我们发布基准、评测工具链、扫描配置和完整运行语料。