论文
分类:通过代码质量信号将软件工程任务路由到具有成本效益的 LLM 层
Triage: Routing Software Engineering Tasks to Cost-Effective LLM Tiers via Code Quality Signals
摘要
背景:AI 编码智能体 将每个任务路由到单个前沿 大语言模型 (LLM),即使许多任务是例行任务,也会支付额外的推理成本。目标:我们提出 Triage,一个使用代码健康指标(软件可维护性指标)作为路由信号的框架,将每个任务分配给最便宜的模型层,其输出通过与昂贵模型相同的验证门。方法:分类定义了三个功能层(轻型、标准、重型——镜像,例如 Haiku、Sonnet、Opus),并根据预先计算的代码健康子因素和任务元数据路由任务。我们设计了一个评估,比较 SWE-bench Lite 上的三种路由策略(跨三个模型层的 300 个任务):启发式阈值、训练有素的 ML 分类器和完美的事后预言机。结果:我们分析得出了两个可证伪的条件,在这两个条件下,层相关的不对称性(中等 LLM 受益于干净的代码,而前沿模型则不然)产生具有成本效益的路由:健康代码的轻层通过率必须超过层间成本比,并且代码健康必须以至少较小的效应大小($\hat{p}\geq 0.56$)区分所需的模型层。结论:分类将诊断代码质量指标转换为可操作的模型选择信号。我们提出了严格的评估协议来测试成本与质量的权衡,并确定哪些代码健康子因素驱动路由决策。