论文

CodeRescue:面向编码智能体的预算校准恢复路由

CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents

智能体系统Agent 规划

摘要

编码智能体日益运行在可执行环境中:一次失败的尝试产出可操作的反馈,而不只是一个错误答案。现有成本感知系统通常把这类失败当作级联决策:先试便宜模型,再把难例升级到更强更贵的模型。但在编码中,执行反馈也能让便宜模型的进一步恢复变得值得,由此产生一个带预算的部署问题:智能体何时该花更多便宜算力、何时该升级?我们把这一失败后决策形式化为异构动作上的恢复路由,并从执行rollout训练一个监督路由器。为使同一路由器在预算变化下可用,我们加入共形风险控制(CRC)层:免重训地选择部署时成本惩罚,并在可交换性下提供边际期望成本控制。在五个编码基准的留出失败上,便宜恢复与升级呈互补的成功模式;校准前沿优于固定动作、仅提示路由器与二元级联基线。在主设定GPT-5.4-nano/GPT-5.4中,一个经CRC校准的前沿点在超过“总是升级”解决率的同时,只用了其平均恢复成本的35%。代码见https://github.com/Qijia-He/agent-budget-control。

CodeRescue:面向编码智能体的预算校准恢复路由:论文配图
图 1:预算控制的恢复路线。在廉价编码尝试失败后,路由器使用问题、结论和 stderr 来对恢复操作进行评分。 CRC 将用户预算 BB 映射到成本惩罚 λ^​(B)\widehat{\lambda}(B),在重新执行之前从同一经过训练的路由器产生不同的预算操作点。