技术实践

得物以无锁调度与断点续传优化推荐评测成本

AI 基础设施模型推理批处理与并行推理服务可观测性

概述

为支撑单周百万级 LLM 评测调用,得物推荐评测平台在工程层做了四项设计:调度核心采用 CAS(Compare-And-Swap)抢占机制而非分布式锁,调度器每分钟扫描一次待执行实例并用一条原子 SQL 完成抢锁,依赖 MySQL 行级锁保证多节点竞争时只有一个节点 rowcount = 1,其余节点本轮直接跳过,无需引入 Redis/ZooKeeper 等外部依赖,宿主机宕机后超过 30 分钟心跳超时的实例可被任意存活节点自动接管做到故障自愈。 百万级任务执行常需数小时,平台以进度技术字段记录三个阶段各自的执行进度,任务在任意阶段中断后重启均可从断点精确续跑,不产生重复评测或数据空洞。并发控制上,文本 LLM 评测采用 ThreadPoolExecutor 分批并发且并发度可通过配置中心热更新,无需重启服务,多模态视觉评测则以单次多模态请求替代多次图片请求,在减少 API 调用次数的同时显著降低单次 Token 消耗。 控本上采用按需触发(定时调度 / 文件上传 / 按需 Ad hoc 三种模式均无闲置轮询)、模型分级(Qwen3 用于高精度场景、轻量模型用于快速验证,高精度走重模型、批量验证走轻模型)与评测样本流式分页采样三重机制。在支撑同等百万级审计需求下,Axis 将单周算力成本控制在万元级左右,相比传统人工模式节省 91% 的资源投入。