论文
TACIT-Switch:从删失监督中学习智能体的低成本模型升级策略
TACIT-Switch: Cost-Aware Model Escalation for LLM Agents from Censored Supervision
摘要
具有较小语言模型主干的代理成本较低,但可能会陷入持续性故障模式,而具有较大主干的代理通常更可靠,但成本更高。这种可靠性与成本的权衡促使路由方法决定何时调用具有更大主干的代理:执行之前、固定轨迹前缀之后或在本地的各个步骤。我们的方法 TACIT-SWITCH 从积累的轨迹证据和教师注释的删失干预时间 (TACIT) 中学习永久的切换策略。它将每个注释表示为累积风险量表上的区间删失观察。由此产生的混合治愈阈值模型估计配对强模型采样轨迹成功的概率,以及以成功为条件的切换阈值;部署时不需要教师模型。在基于机制的多步骤模拟中,TACIT-SWITCH 在同等成本下比任务级、步骤级和固定前缀路由基线提高了 7.4-11.1 个百分点的成功率。在受控模拟中,消融显示任务特征和累积轨迹风险提供了补充信息。通过根据开发数据选择操作点,TACIT-SWITCH 在 ALFWorld 上的学习策略中取得了最高的留出集成功率(4B Cheap 为 48.5%;9B Cheap 为 45.5%)和 DABench (73.1%)。