论文
少推理、按需升级:面向边缘LLM Agent的校准推理与不确定性转交
Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents
摘要
遵循 ReAct 范式的 LLM 代理有望成为复杂多步骤任务的推动者,包括多跳问答、代码生成和物理 AI 系统的控制。然而,当部署在边缘时,它们必须严格管理其推理预算,同时保持可靠,并仅在本地不确定性太高而无法安全操作时才遵循云端模型。我们提出 Think Short, Defer Smart (TSDS),这是一个协同集成轻量级收敛探针的框架,一旦预期操作稳定,该探针就会停止设备上的推理,而基于困惑的延迟规则会将不确定的操作升级到云端模型。两种机制通过多目标学习然后测试(LTT)程序在端到端事件轨迹上联合校准,为预期事件奖励和云调用率提供同步有限样本保证。我们在四个 ReAct 基准上评估 TSDS,涵盖算术推理 (GSM8K)、多跳问答 (HotpotQA)、代码生成 (MBPP) 和多步具体规划(家用机器人),并与仅思想校准和仅校准延迟独立基线进行比较。与 HotpotQA、MBPP 和家庭机器人任务中的仅延迟基线相比,TSDS 将每集思维计算量减少了 43%-65%,同时保持经过认证的奖励和云调用率保证。