论文

Hera:面向设备-云协同LLM智能体的长程协调学习

Hera: Learning Long-Horizon Coordination for Device-Cloud Collaborative LLM Agents

模型训练强化学习Agentic RL

摘要

大语言模型(LLM)智能体擅长通过与环境的自主交互解决复杂的长程任务。然而其真实世界部署面临一个根本性的设备-云困境:端侧模型高效但往往脆弱,云端模型更强但计算成本高。最先进的LLM设备-云路由通常做出粗粒度的任务级决策,无法适应多步智能体交互中不断变化的难度。为解决这一问题,我们提出Hera,一种面向长程任务的步级设备-云LLM智能体协调器,实现了强劲的性能-成本Pareto前沿。Hera采用新颖的两阶段训练范式:(1)模仿学习冷启动,随后(2)强化学习联合优化任务成功与云端使用效率。第一阶段将步级路由转化为监督分类问题:在云端轨迹上重放设备智能体,每个状态由设备与云动作是否一致来标注。第二阶段通过跨轨迹对相同状态分组,并用偏向更高期望回报和更少未来云端调用的标签更新Hera,进行成本感知强化学习。我们在ALFWorld、WebShop和AppWorld上评估Hera,它持续超越先前方法,仅用46.3%的步数调用云端,即达到纯云端成功率的92.5%。

Hera:面向设备-云协同LLM智能体的长程协调学习:论文配图
图 1:LLM 代理面临根本性的设备 - 云困境。为了解决这个问题,Hera 被提议作为一种轻量级的设备-云协调器,通过两阶段范式进行训练:冷启动的模仿学习,然后是性能成本协同优化的强化学习。