论文

QuantClaw:为OpenClaw把精度用在关键处

QuantClaw: Precision Where It Matters for OpenClaw

摘要

诸如OpenClaw之类的自主智能体系统,由于长上下文输入与多轮推理而带来显著的效率挑战。这导致现实开发中高得令人却步的计算与金钱成本。尽管量化是降低成本与延迟的标准手段,但其在真实场景中对智能体性能的影响仍不明确。在本工作中,我们分析了OpenClaw上多种复杂工作流的量化敏感性,并表明精度需求高度依赖任务。基于这一观察,我们提出QuantClaw,一个即插即用的精度路由插件,根据任务特征动态分配精度。QuantClaw将轻量任务路由到更低成本的配置,同时为高要求的工作负载保留更高精度,在不增加用户复杂度的前提下节省成本并加速推理。实验表明,QuantClaw在降低延迟与计算成本的同时,维持甚至提升了任务性能。在一系列智能体任务上,它在GLM-5(FP8基线)上实现了最高21.4%的成本节省与15.7%的延迟降低。这些结果凸显了在智能体系统中将精度视为动态资源的好处。

QuantClaw:为OpenClaw把精度用在关键处:论文配图
图 4:QuantClaw 的整体流程。用户查询首先被识别为不同的任务类别,并由混合检测机制支持。然后,QuantClaw 根据预先计算的任务精确灵敏度配置文件执行精确路由。维护模型变体池以支持部署的首选精度。